TY - RPRT TI - Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning AU - Byeongchan Kim AU - Min-hwan Oh PY - 2026 UR - https://arxiv.org/abs/2605.14779 ID - 2605.14779 ER -