TY - RPRT TI - Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning AU - Motoki Omura AU - Kazuki Ota AU - Takayuki Osa AU - Yusuke Mukuta AU - Tatsuya Harada PY - 2025 UR - https://arxiv.org/abs/2506.05968 ID - 2506.05968 ER -