TY - RPRT TI - ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization AU - Yifei Chen AU - Shaoqin Zhu AU - Xiaoqiang Ji PY - 2026 UR - https://arxiv.org/abs/2605.18320 ID - 2605.18320 ER -