TY - RPRT TI - Provably Efficient Offline Reinforcement Learning with Trajectory-Wise Reward AU - Tengyu Xu AU - Yue Wang AU - Shaofeng Zou AU - Yingbin Liang PY - 2023 UR - https://arxiv.org/abs/2206.06426 ID - 2206.06426 ER -