TY - RPRT TI - Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search AU - Maohao Shen AU - Guangtao Zeng AU - Zhenting Qi AU - Zhang-Wei Hong AU - Zhenfang Chen AU - Wei Lu AU - Gregory Wornell AU - Subhro Das AU - David Cox AU - Chuang Gan PY - 2025 UR - https://arxiv.org/abs/2502.02508 ID - 2502.02508 ER -