TY - RPRT TI - Convergent NMPC-based Reinforcement Learning Using Deep Expected Sarsa and Nonlinear Temporal Difference Learning AU - Amine Salaje AU - Thomas Chevet AU - Nicolas Langlois PY - 2025 UR - https://arxiv.org/abs/2502.04925 ID - 2502.04925 ER -