TY - RPRT TI - Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty AU - Yanwei Jia PY - 2026 UR - https://arxiv.org/abs/2404.12598 ID - 2404.12598 ER -