Rethinking Reward Models for Multi-Domain Test-Time Scaling
DGX agentarXiv:2510.00492v3 Announce Type: replace Abstract: The reliability of large language models (LLMs) during test-time scaling is often assessed with external verifiers or reward models that distinguish