TY - RPRT TI - Variance-Averse $n$-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments AU - Guhyeon Kang AU - Minhae Kwon PY - 2026 UR - https://arxiv.org/abs/2610.07899 ID - 2610.07899 ER -