TY - RPRT TI - Doubly Optimal Policy Evaluation for Reinforcement Learning AU - Shuze Daniel Liu AU - Claire Chen AU - Shangtong Zhang PY - 2025 UR - https://arxiv.org/abs/2410.02226 ID - 2410.02226 ER -