@misc{indiciae5bd0f0a20ff4, title = {HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading}, author = {Cheng Luo and Zefan Cai and Hanshi Sun and Jinqi Xiao and Bo Yuan and Wen Xiao and Junjie Hu and Jiawei Zhao and Beidi Chen and Anima Anandkumar}, year = {2025}, url = {https://arxiv.org/abs/2502.12574}, note = {Source identifier: 2502.12574} }