TY - RPRT TI - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation AU - Yuxin Jiang AU - Yufei Wang AU - Qiyuan Zhang AU - Xingshan Zeng AU - Liangyou Li AU - Jierun Chen AU - Chaofan Tao AU - Haoli Bai AU - Lifeng Shang PY - 2026 UR - https://arxiv.org/abs/2601.18533 ID - 2601.18533 ER -