MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models
DGX agentarXiv:2604.19809v1 Announce Type: new Abstract: We introduce MIRROR, a benchmark comprising eight experiments across four metacognitive levels that evaluates whether large language models can use self