TY - RPRT TI - Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning AU - Shiwan Zhao AU - Zhihu Wang AU - Xuyang Zhao AU - Jiaming Zhou AU - Caiyue Xu AU - Chenfei Liu AU - Liting Zhang AU - Yuhang Jia AU - Yanzhe Zhang AU - Hualong Yu AU - Zichen Xu AU - Qicheng Li AU - Yong Qin PY - 2026 UR - https://arxiv.org/abs/2604.07941 ID - 2604.07941 ER -