TY - RPRT TI - Accelerating RL for LLM Reasoning with Optimal Advantage Regression AU - Kianté Brantley AU - Mingyu Chen AU - Zhaolin Gao AU - Jason D. Lee AU - Wen Sun AU - Wenhao Zhan AU - Xuezhou Zhang PY - 2025 UR - https://arxiv.org/abs/2505.20686 ID - 2505.20686 ER -