TY - RPRT TI - ARM: Advantage Reward Modeling for Long-Horizon Manipulation AU - Yiming Mao AU - Zixi Yu AU - Weixin Mao AU - Yinhao Li AU - Qirui Hu AU - Zihan Lan AU - Minzhao Zhu AU - Hua Chen PY - 2026 UR - https://arxiv.org/abs/2604.03037 ID - 2604.03037 ER -