TY - RPRT TI - RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs AU - Runlong Zhou AU - Lefan Zhang AU - Shang-Chen Wu AU - Kelvin Zou AU - Hanzhi Zhou AU - Ke Ye AU - Yihao Feng AU - Dong Yin AU - Alex Guillen Garcia AU - Dmytro Babych AU - Rohit Chatterjee AU - Matthew Hopkins AU - Xiang Kong AU - Chang Lan AU - Lezhi Li AU - Yiping Ma AU - Daniele Molinari AU - Senyu Tong AU - Yanchao Sun AU - Thomas Voice AU - Jianyu Wang AU - Chong Wang AU - Simon Wang AU - Floris Weers AU - Yechen Xu AU - Guolin Yin AU - Muyang Yu AU - Yi Zhang AU - Zheng Zhou AU - Danyang Zhuo AU - Ruoming Pang AU - Cheng Leong PY - 2025 UR - https://arxiv.org/abs/2512.06392 ID - 2512.06392 ER -