TY - RPRT TI - Pessimistic Q-Learning for Offline Reinforcement Learning: Towards Optimal Sample Complexity AU - Laixi Shi AU - Gen Li AU - Yuting Wei AU - Yuxin Chen AU - Yuejie Chi PY - 2022 UR - https://arxiv.org/abs/2202.13890 ID - 2202.13890 ER -