RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training
DGX agentarXiv:2606.04272v1 Announce Type: new Abstract: The standard LLM training pipeline applies reinforcement learning (RL) only after pre-training and supervised fine-tuning (SFT). We question this status