@misc{indiciae245955eb7e07, title = {Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping}, author = {Yao Chen and Yilong Chen and Yinqi Yang and Junyuan Shang and Zhenyu Zhang and Zefeng Zhang and Shuaiyi Nie and Shuohuan Wang and Yu Sun and Hua Wu and HaiFeng Wang and Tingwen Liu}, year = {2026}, url = {https://arxiv.org/abs/2603.23998}, note = {Source identifier: 2603.23998} }