MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
arXiv:2505.17123v3 Announce Type: replace Abstract: Recent advances in Large Language Models (LLMs) have shown promising results in complex reasoning tasks. However, current evaluations predominantly