TY - RPRT TI - Improving Data and Reward Design for Scientific Reasoning in Large Language Models AU - Zijie Chen AU - Zhenghao Lin AU - Xiao Liu AU - Zhenzhong Lan AU - Yeyun Gong AU - Peng Cheng PY - 2026 UR - https://arxiv.org/abs/2602.08321 ID - 2602.08321 ER -