FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning
DGX agentarXiv:2601.18150v2 Announce Type: replace-cross Abstract: Reinforcement learning (RL) for large language models (LLMs) is increasingly bottlenecked by rollout (generation), where long output sequence