League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
DGX agentarXiv:2507.22359v4 Announce Type: replace Abstract: Although large language models (LLMs) have shown exceptional capabilities across a wide range of tasks, reliable evaluation remains a critical chall