TY - RPRT TI - Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards AU - Xinyu Tang AU - Yuliang Zhan AU - Zhixun Li AU - Wayne Xin Zhao AU - Zhenduo Zhang AU - Zujie Wen AU - Zhiqiang Zhang AU - Jun Zhou PY - 2025 UR - https://arxiv.org/abs/2512.21625 ID - 2512.21625 ER -