TY - RPRT TI - OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling AU - Zengzhi Wang AU - Fan Zhou AU - Xuefeng Li AU - Pengfei Liu PY - 2025 UR - https://arxiv.org/abs/2506.20512 ID - 2506.20512 ER -