TY - RPRT TI - Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation AU - Haichen Hu AU - Jian Qian AU - David Simchi-Levi PY - 2026 UR - https://arxiv.org/abs/2605.00393 ID - 2605.00393 ER -