TY - RPRT TI - Optimal Uniform OPE and Model-based Offline Reinforcement Learning in Time-Homogeneous, Reward-Free and Task-Agnostic Settings AU - Ming Yin AU - Yu-Xiang Wang PY - 2021 UR - https://arxiv.org/abs/2105.06029 ID - 2105.06029 ER -