TY - RPRT TI - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers AU - Xin-Qiang Cai AU - Wei Wang AU - Feng Liu AU - Tongliang Liu AU - Gang Niu AU - Masashi Sugiyama PY - 2026 UR - https://arxiv.org/abs/2510.00915 ID - 2510.00915 ER -