TY - RPRT TI - On-Policy RL with Optimal Reward Baseline AU - Yaru Hao AU - Li Dong AU - Xun Wu AU - Shaohan Huang AU - Zewen Chi AU - Furu Wei PY - 2025 UR - https://arxiv.org/abs/2505.23585 ID - 2505.23585 ER -