RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning
DGX agentarXiv:2606.07006v1 Announce Type: cross Abstract: Supervised fine-tuning (SFT) is a prevailing method for adapting large language models to reasoning tasks by imitating offline expert demonstrations,