Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
DGX agentarXiv:2507.16806v2 Announce Type: replace-cross Abstract: When language models (LMs) are trained via reinforcement learning (RL) to generate natural language 'reasoning chains', their performance impr