TY - RPRT TI - More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning AU - Kaiwen Wang AU - Owen Oertell AU - Alekh Agarwal AU - Nathan Kallus AU - Wen Sun PY - 2024 UR - https://arxiv.org/abs/2402.07198 ID - 2402.07198 ER -