TY - RPRT TI - ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training AU - Yu Liang AU - Liangxin Liu AU - Longzheng Wang AU - Yan Wang AU - Yueyang Zhang AU - Long Xia AU - Zhiyuan Sun AU - Daiting Shi PY - 2026 UR - https://arxiv.org/abs/2604.07484 ID - 2604.07484 ER -