TY - RPRT TI - ByteScale: Efficient Scaling of LLM Training with a 2048K Context Length on More Than 12,000 GPUs AU - Hao Ge AU - Junda Feng AU - Qi Huang AU - Fangcheng Fu AU - Xiaonan Nie AU - Lei Zuo AU - Haibin Lin AU - Bin Cui AU - Xin Liu PY - 2025 DO - 10.1145/3718958.3754352 UR - https://arxiv.org/abs/2502.21231 ID - 2502.21231 ER -