InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning
DGX agentarXiv:2602.06960v3 Announce Type: replace-cross Abstract: Large reasoning models achieve strong performance by scaling inference-time chain-of-thought, but this paradigm suffers from quadratic cost, c