TY - RPRT TI - MoMA: Model-based Mirror Ascent for Offline Reinforcement Learning AU - Mao Hong AU - Zhiyue Zhang AU - Yue Wu AU - Yanxun Xu PY - 2024 UR - https://arxiv.org/abs/2401.11380 ID - 2401.11380 ER -