TY - RPRT TI - ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning AU - Ziyu Wan AU - Yunxiang Li AU - Xiaoyu Wen AU - Yan Song AU - Hanjing Wang AU - Linyi Yang AU - Mark Schmidt AU - Jun Wang AU - Weinan Zhang AU - Shuyue Hu AU - Ying Wen PY - 2025 UR - https://arxiv.org/abs/2503.09501 ID - 2503.09501 ER -