TY - RPRT TI - Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents AU - Haochen Sun AU - Shuwen Zhang AU - Lujie Niu AU - Lei Ren AU - Hao Xu AU - Hao Fu AU - Fangkun Zhao AU - Caixia Yuan AU - Xiaojie Wang PY - 2025 DO - 10.18653/v1/2025.emnlp-main.249 UR - https://arxiv.org/abs/2502.20073 ID - 2502.20073 ER -