TY - RPRT TI - End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning AU - Guanzhong Chen AU - Shaoxiong Yang AU - Chao Li AU - Wei Liu AU - Jian Luan AU - Zenglin Xu PY - 2026 UR - https://arxiv.org/abs/2506.02718 ID - 2506.02718 ER -