TY - RPRT TI - DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning AU - Chi-Min Chan AU - Ehsan Hajiramezanali AU - Xiner Li AU - Edward De Brouwer AU - Carl Edwards AU - Wei Xue AU - Sirui Han AU - Yike Guo AU - Gabriele Scalia PY - 2026 UR - https://arxiv.org/abs/2603.08095 ID - 2603.08095 ER -