Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback
arXiv:2605.30478v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) trains language models using programmatically checkable signals such as unit-test outcomes, enab