RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
DGX agentarXiv:2605.10899v1 Announce Type: new Abstract: Training deep research agents, namely systems that plan, search, evaluate evidence, and synthesize long-form reports, pushes reinforcement learning beyo