TY - RPRT TI - Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization AU - Hanyu Li AU - Jiangshan Duo AU - Bofei Gao AU - Hailin Zhang AU - Sujian Li AU - Xiaotie Deng AU - Liang Zhao PY - 2026 UR - https://arxiv.org/abs/2601.06052 ID - 2601.06052 ER -