@misc{indiciae235f37188898, title = {From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement}, author = {Qinsi Wang and Jing Shi and Huazheng Wang and Kun Wan and Yiran Wu and Bo Liu and Qingyun Wu and Hai Helen Li and Yiran Chen and Handong Zhao and Wentian Zhao}, year = {2026}, url = {https://arxiv.org/abs/2607.23802}, note = {Source identifier: 2607.23802} }