TY - RPRT TI - Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model AU - Ling Team AU - Anqi Shen AU - Baihui Li AU - Bin Hu AU - Bin Jing AU - Cai Chen AU - Chao Huang AU - Chao Zhang AU - Chaokun Yang AU - Cheng Lin AU - Chengyao Wen AU - Congqi Li AU - Deng Zhao AU - Dingbo Yuan AU - Donghai You AU - Fagui Mao AU - Fanzhuang Meng AU - Feng Xu AU - Guojie Li AU - Guowei Wang AU - Hao Dai AU - Haonan Zheng AU - Hong Liu AU - Jia Guo AU - Jiaming Liu AU - Jian Liu AU - Jianhao Fu AU - Jiannan Shi AU - Jianwen Wang AU - Jianxin Lai AU - Jin Yang AU - Jun Mei AU - Jun Zhou AU - Junbo Zhao AU - Junping Zhao AU - Kuan Xu AU - Le Su AU - Lei Chen AU - Li Tang AU - Liang Jiang AU - Liangcheng Fu AU - Lianhao Xu AU - Linfeng Shi AU - Lisha Liao AU - Longfei Zheng AU - Meng Li AU - Mingchun Chen AU - Qi Zuo AU - Qiang Cheng AU - Qianggang Cao AU - Qitao Shi AU - Quanrui Guo AU - Senlin Zhu AU - Shaofei Wang AU - Shaomian Zheng AU - Shuaicheng Li AU - Shuwei Gu AU - Siba Chen AU - Tao Wu AU - Tao Zhang AU - Tianyu Zhang AU - Tianyu Zhou AU - Tiwei Bie AU - Tongkai Yang AU - Wang Hong AU - Wang Ren AU - Weihua Chen AU - Wenbo Yu AU - Wengang Zheng AU - Xiangchun Wang AU - Xiaodong Yan AU - Xiaopei Wan AU - Xin Zhao AU - Xinyu Kong AU - Xinyu Tang AU - Xudong Han AU - Xudong Wang AU - Xuemin Yang AU - Xueyu Hu AU - Yalin Zhang AU - Yan Sun AU - Yicheng Shan AU - Yilong Wang AU - Yingying Xu AU - Yongkang Liu AU - Yongzhen Guo AU - Yuanyuan Wang AU - Yuchen Yan AU - Yuefan Wang AU - Yuhong Guo AU - Zehuan Li AU - Zhankai Xu AU - Zhe Li AU - Zhenduo Zhang AU - Zhengke Gui AU - Zhenxuan Pan AU - Zhenyu Huang AU - Zhenzhong Lan AU - Zhiqiang Ding AU - Zhiqiang Zhang PY - 2025 UR - https://arxiv.org/abs/2510.18855 ID - 2510.18855 ER -