@misc{indiciaeba91f0dce1a4, title = {From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models}, author = {Chejian Xu and Wei Ping and Peng Xu and Zihan Liu and Boxin Wang and Mohammad Shoeybi and Bo Li and Bryan Catanzaro}, year = {2025}, url = {https://arxiv.org/abs/2504.06214}, note = {Source identifier: 2504.06214} }