CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
arXiv:2507.15698v2 Announce Type: replace-cross Abstract: Process Reward Models (PRMs) play a central role in evaluating and guiding multi-step reasoning in large language models (LLMs), especially fo