TY - RPRT TI - Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs AU - Meichen Song AU - Yuhao Wang AU - Enlu Zhou PY - 2026 UR - https://arxiv.org/abs/2605.24345 ID - 2605.24345 ER -