Embodiment-Induced Coordination Regimes in Tabular Multi-Agent Q-Learning
arXiv:2601.17454v2 Announce Type: replace-cross Abstract: Centralized value learning underlies a broad class of multi-agent reinforcement learning methods, but its claimed advantage is typically evalu