@misc{indiciae9dc8a55b6a35, title = {Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation}, author = {Shaoyuan Chen and Wencong Xiao and Yutong Lin and Mingxing Zhang and Yingdi Shan and Jinlei Jiang and Kang Chen and Yongwei Wu}, year = {2025}, url = {https://arxiv.org/abs/2405.01814}, note = {Source identifier: 2405.01814} }