TY - RPRT TI - LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization AU - Qi Zhang AU - Shouqing Yang AU - Lirong Gao AU - Hao Chen AU - Xiaomeng Hu AU - Jinglei Chen AU - Jiexiang Wang AU - Sheng Guo AU - Bo Zheng AU - Haobo Wang AU - Junbo Zhao PY - 2025 UR - https://arxiv.org/abs/2505.17447 ID - 2505.17447 ER -