TY - RPRT TI - From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement AU - Qinsi Wang AU - Jing Shi AU - Huazheng Wang AU - Kun Wan AU - Yiran Wu AU - Bo Liu AU - Qingyun Wu AU - Hai Helen Li AU - Yiran Chen AU - Handong Zhao AU - Wentian Zhao PY - 2026 UR - https://arxiv.org/abs/2607.23802 ID - 2607.23802 ER -