Future-KL Regularized GRPO: Process-Level Credit Assignment from f-Divergence Regularization
DGX agentarXiv:2601.10201v2 Announce Type: replace-cross Abstract: Group Relative Policy Optimization (GRPO) is widely used for critic-free Large Language Model (LLM) post-training, but its KL regularization i