Generalization Hacking: Models Can Game Reinforcement Learning by Preventing Behavioral Generalization
DGX agentarXiv:2606.12016v1 Announce Type: cross Abstract: Model post-training, and in particular reinforcement learning (RL), is one of the primary mechanisms by which developers can shape models' values and