TY - RPRT TI - Robust Bayesian Dynamic Programming for On-policy Risk-sensitive Reinforcement Learning AU - Shanyu Han AU - Yangbo He AU - Yang Liu PY - 2025 UR - https://arxiv.org/abs/2512.24580 ID - 2512.24580 ER -