An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning
DGX agentarXiv:2504.18587v2 Announce Type: replace-cross Abstract: Reinforcement learning has emerged as a powerful approach for improving the reasoning capabilities of large language models, as demonstrated b