TY - RPRT TI - Coevolving with the Other You: Fine-Tuning LLM with Sequential Cooperative Multi-Agent Reinforcement Learning AU - Hao Ma AU - Tianyi Hu AU - Zhiqiang Pu AU - Boyin Liu AU - Xiaolin Ai AU - Yanyan Liang AU - Min Chen PY - 2025 UR - https://arxiv.org/abs/2410.06101 ID - 2410.06101 ER -