TY - RPRT TI - MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs AU - Huining Yuan AU - Zelai Xu AU - Zheyue Tan AU - Xiangmin Yi AU - Mo Guang AU - Kaiwen Long AU - Haojia Hui AU - Boxun Li AU - Xinlei Chen AU - Bo Zhao AU - Xiao-Ping Zhang AU - Chao Yu AU - Yu Wang PY - 2026 UR - https://arxiv.org/abs/2510.15414 ID - 2510.15414 ER -