TY - RPRT TI - LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training AU - Bo Wu AU - Sid Wang AU - Yunhao Tang AU - Jia Ding AU - Eryk Helenowski AU - Liang Tan AU - Tengyu Xu AU - Tushar Gowda AU - Zhengxing Chen AU - Chen Zhu AU - Xiaocheng Tang AU - Yundi Qian AU - Beibei Zhu AU - Rui Hou PY - 2025 UR - https://arxiv.org/abs/2505.24034 ID - 2505.24034 ER -