Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?
DGX agentarXiv:2605.19196v1 Announce Type: new Abstract: Deep research agents increasingly automate complex information-seeking tasks, producing evidence-grounded reports via multi-step reasoning, tool use, an