TY - RPRT TI - Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning AU - Yiqun Chen AU - Jinyuan Feng AU - Wei Yang AU - Meizhi Zhong AU - Zhengliang Shi AU - Rui Li AU - Xiaochi Wei AU - Yan Gao AU - Yi Wu AU - Yao Hu AU - Zhiqiang Pu AU - Jiaxin Mao PY - 2026 UR - https://arxiv.org/abs/2601.21919 ID - 2601.21919 ER -