TY - RPRT TI - Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs AU - Ling Team AU - Bin Hu AU - Cai Chen AU - Deng Zhao AU - Ding Liu AU - Dingnan Jin AU - Feng Zhu AU - Hao Dai AU - Hongzhi Luan AU - Jia Guo AU - Jiaming Liu AU - Jiewei Wu AU - Jun Mei AU - Jun Zhou AU - Junbo Zhao AU - Junwu Xiong AU - Kaihong Zhang AU - Kuan Xu AU - Lei Liang AU - Liang Jiang AU - Liangcheng Fu AU - Longfei Zheng AU - Qiang Gao AU - Qing Cui AU - Quan Wan AU - Shaomian Zheng AU - Shuaicheng Li AU - Tongkai Yang AU - Wang Ren AU - Xiaodong Yan AU - Xiaopei Wan AU - Xiaoyun Feng AU - Xin Zhao AU - Xinxing Yang AU - Xinyu Kong AU - Xuemin Yang AU - Yang Li AU - Yingting Wu AU - Yongkang Liu AU - Zhankai Xu AU - Zhenduo Zhang AU - Zhenglei Zhou AU - Zhenyu Huang AU - Zhiqiang Zhang AU - Zihao Wang AU - Zujie Wen PY - 2025 UR - https://arxiv.org/abs/2506.14731 ID - 2506.14731 ER -