SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning
DGX agentarXiv:2604.01993v2 Announce Type: replace-cross Abstract: Multi-hop QA benchmarks often reward Large Language Models (LLMs) for spurious correctness, where models reach correct answers through invalid