TY - RPRT TI - Multi-step Proximal Policy Improvement in Offline Reinforcement Learning AU - Soohyun Choi AU - Seonvin Cho AU - Songnam Hong PY - 2026 UR - https://arxiv.org/abs/2609.03842 ID - 2609.03842 ER -