TY - RPRT TI - Off-Policy Value-Based Reinforcement Learning for Large Language Models AU - Peng-Yuan Wang AU - Ziniu Li AU - Tian Xu AU - Bohan Yang AU - Tian-Shuo Liu AU - ChenYang Wang AU - Xiong-Hui Chen AU - Yi-Chen Li AU - Tianyun Yang AU - Congliang Chen AU - Yang Yu PY - 2026 UR - https://arxiv.org/abs/2603.23355 ID - 2603.23355 ER -