TY - RPRT TI - Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs AU - Wei Yang AU - Jiacheng Pang AU - Shixuan Li AU - Paul Bogdan AU - Stephen Tu AU - Jesse Thomason PY - 2025 UR - https://arxiv.org/abs/2511.06134 ID - 2511.06134 ER -