@misc{indiciae019561b19b70, title = {Off-Policy Value-Based Reinforcement Learning for Large Language Models}, author = {Peng-Yuan Wang and Ziniu Li and Tian Xu and Bohan Yang and Tian-Shuo Liu and ChenYang Wang and Xiong-Hui Chen and Yi-Chen Li and Tianyun Yang and Congliang Chen and Yang Yu}, year = {2026}, url = {https://arxiv.org/abs/2603.23355}, note = {Source identifier: 2603.23355} }