GFlowRL: Scaling Distribution-Matching RL to Large Language Models
DGX agentarXiv:2607.13394v1 Announce Type: cross Abstract: Generative Flow Networks (GFlowNets) offer a promising alternative to reward-maximizing reinforcement learning (RL) for large reasoning models, encour