Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models
arXiv:2503.13551v5 Announce Type: replace Abstract: Recent studies show that Large Language Models (LLMs) achieve strong reasoning capabilities through supervised fine-tuning or reinforcement learning