TY - RPRT TI - Training Multi-Image Vision Agents via End2End Reinforcement Learning AU - Chengqi Dong AU - Chuhuai Yue AU - Hang He AU - Rongge Mao AU - Fenghe Tang AU - S Kevin Zhou AU - Zekun Xu AU - Xiaohan Wang AU - Jiajun Chai AU - Guojun Yin PY - 2026 UR - https://arxiv.org/abs/2512.08980 ID - 2512.08980 ER -