@misc{indiciae09a6147e258a, title = {Cross-layer Attention Sharing for Pre-trained Large Language Models}, author = {Yongyu Mu and Yuzhang Wu and Yuchun Fan and Chenglong Wang and Hengyu Li and Jiali Zeng and Qiaozhi He and Murun Yang and Fandong Meng and Jie Zhou and Tong Xiao and Jingbo Zhu}, year = {2025}, url = {https://arxiv.org/abs/2408.01890}, note = {Source identifier: 2408.01890} }