TY - RPRT TI - Off-policy Reinforcement Learning with Model-based Exploration Augmentation AU - Likun Wang AU - Xiangteng Zhang AU - Yinuo Wang AU - Guojian Zhan AU - Wenxuan Wang AU - Haoyu Gao AU - Jingliang Duan AU - Shengbo Eben Li PY - 2025 UR - https://arxiv.org/abs/2510.25529 ID - 2510.25529 ER -