TY - RPRT TI - Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE AU - Anxiang Zeng AU - Haibo Zhang AU - Hailing Zhang AU - Kaixiang Mo AU - Liang Yao AU - Ling Hu AU - Long Zhang AU - Shuman Liu AU - Shuyi Xie AU - Yanshi Li AU - Yizhang Chen AU - Yuepeng Sheng AU - Yuwei Huang AU - Zhaochen Xu AU - Zhiqiang Zhou AU - Ziqin Liew PY - 2025 UR - https://arxiv.org/abs/2512.07710 ID - 2512.07710 ER -