Margin-Adaptive Confidence Ranking for Reliable LLM Judgement
DGX agentarXiv:2605.15416v1 Announce Type: cross Abstract: Jung et al. (2025) introduce a hypothesis testing framework for guaranteeing agreement between large language models (LLMs) and human judgments, relyi