TY - RPRT TI - DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training AU - Tianhao Hu AU - Xiangcheng Liu AU - Yuchun Miao AU - Youshao Xiao AU - Hongyu Zang AU - Yang Zheng AU - Xuan Huang AU - Jinrui Ding AU - Yufei Zhang AU - Yu Yang AU - Yi-Kai Zhang AU - Yueqing Sun AU - Chengcheng Han AU - Xiandi Ma AU - Wei Wang AU - Qi Gu AU - Yerui Sun AU - Yuchen Xie AU - Xunliang Cai PY - 2026 UR - https://arxiv.org/abs/2604.26256 ID - 2604.26256 ER -