Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
arXiv:2605.16302v1 Announce Type: cross Abstract: Reinforcement learning for multi-step reasoning with large language models (LLMs) often relies on sparse terminal rewards, leading to poor credit assi