TY - RPRT TI - Optimistic Reinforcement Learning with Quantile Objectives AU - Mohammad Alipour-Vaezi AU - Huaiyang Zhong AU - Kwok-Leung Tsui AU - Sajad Khodadadian PY - 2025 UR - https://arxiv.org/abs/2511.09652 ID - 2511.09652 ER -