The Trust Paradox: How CS Researchers Engage LLM Leaderboards
DGX agentarXiv:2605.28966v1 Announce Type: new Abstract: Large language model (LLM) leaderboards rank AI models using standardized benchmarks and have become highly visible across computer science, despite kno