TY - RPRT TI - Minimax Optimal Reinforcement Learning with Quasi-Optimism AU - Harin Lee AU - Min-hwan Oh PY - 2025 UR - https://arxiv.org/abs/2503.00810 ID - 2503.00810 ER -