TY - RPRT TI - Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction AU - Fei Ding AU - Yongkang Zhang AU - Runhao Liu AU - Yuhao Liao AU - Zijian Zeng AU - Huiming Yang AU - Sibo wang AU - Linglin Liao PY - 2026 UR - https://arxiv.org/abs/2604.17328 ID - 2604.17328 ER -