@misc{indiciae352997eba179, title = {From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation}, author = {Yuxin Jiang and Yufei Wang and Qiyuan Zhang and Xingshan Zeng and Liangyou Li and Jierun Chen and Chaofan Tao and Haoli Bai and Lifeng Shang}, year = {2026}, url = {https://arxiv.org/abs/2601.18533}, note = {Source identifier: 2601.18533} }