TY - RPRT TI - AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning AU - Chenwei Lou AU - Zewei Sun AU - Xinnian Liang AU - Meng Qu AU - Wei Shen AU - Wenqi Wang AU - Yuntao Li AU - Qingping Yang AU - Shuangzhi Wu PY - 2025 UR - https://arxiv.org/abs/2505.11896 ID - 2505.11896 ER -