ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning
DGX agentarXiv:2605.18799v1 Announce Type: cross Abstract: Large language models can fail in critic interaction not only by answering incorrectly, but also by abandoning an initially correct scientific solutio