Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning
DGX agentarXiv:2608.05643v1 Announce Type: new Abstract: Test-time scaling improves LLM reasoning by using additional inference compute, but wider sampling alone can suffer from diminishing returns: new rollou