TY - RPRT TI - Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization AU - Yueyang Cang AU - Xiaoteng Zhang AU - Erlu Zhao AU - Zehua Ji AU - Yuhang Liu AU - Yuchen He AU - Zhiyuan Ning AU - Chen Yijun AU - Wenge Que AU - Li Shi PY - 2026 UR - https://arxiv.org/abs/2603.02701 ID - 2603.02701 ER -