TY - RPRT TI - Deterministic Policy Gradient for Reinforcement Learning with Continuous Time and State AU - Ziheng Cheng AU - Xin Guo AU - Yufei Zhang PY - 2026 UR - https://arxiv.org/abs/2509.23711 ID - 2509.23711 ER -