TY - RPRT TI - Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL AU - Jiarui Yao AU - Yifan Hao AU - Hanning Zhang AU - Hanze Dong AU - Wei Xiong AU - Nan Jiang AU - Tong Zhang PY - 2025 UR - https://arxiv.org/abs/2505.02391 ID - 2505.02391 ER -