Deterministic Policy Gradient for Learning Equilibrium in Time-Inconsistent Control Problems
DGX agentarXiv:2606.11798v1 Announce Type: cross Abstract: In this paper, we develop a continuous-time model-free reinforcement learning algorithm to learn deterministic equilibrium policies in general time-in