TY - RPRT TI - MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models AU - Dohwan Ko AU - Jinyoung Park AU - Seoung Choi AU - Sanghyeok Lee AU - Seohyun Lee AU - Hyunwoo J. Kim PY - 2026 UR - https://arxiv.org/abs/2603.24984 ID - 2603.24984 ER -