TY - RPRT TI - BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning AU - Yubao Zhao AU - Weiquan Huang AU - Sudong Wang AU - Ruochen Zhao AU - Chen Chen AU - Yao Shu AU - Chengwei Qin PY - 2026 UR - https://arxiv.org/abs/2602.03719 ID - 2602.03719 ER -