TY - RPRT TI - Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards AU - Xiaoyuan Liu AU - Tian Liang AU - Zhiwei He AU - Jiahao Xu AU - Wenxuan Wang AU - Pinjia He AU - Zhaopeng Tu AU - Haitao Mi AU - Dong Yu PY - 2025 UR - https://arxiv.org/abs/2505.13445 ID - 2505.13445 ER -