Synthetic POMDPs to Challenge Memory-Augmented RL: Memory Demand Structure Modeling
DGX agentarXiv:2508.04282v3 Announce Type: replace Abstract: Recent benchmarks for memory-augmented reinforcement learning (RL) have introduced partially observable Markov decision process (POMDP) environments