TY - RPRT TI - Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO AU - Haoyang Hong AU - Jiajun Yin AU - Yuan Wang AU - Jingnan Liu AU - Zhe Chen AU - Ailing Yu AU - Ji Li AU - Zhiling Ye AU - Hansong Xiao AU - Yefei Chen AU - Hualei Zhou AU - Yun Yue AU - Minghui Yang AU - Chunxiao Guo AU - Junwei Liu AU - Peng Wei AU - Jinjie Gu PY - 2025 UR - https://arxiv.org/abs/2511.13288 ID - 2511.13288 ER -