Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions
arXiv:2606.03382v1 Announce Type: cross Abstract: While Proximal Policy Optimization (PPO) demonstrates strong performance in stationary settings, we show that its standard optimization paradigm strug