@misc{indiciaed48591dffd13, title = {ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching}, author = {Youpeng Zhao and Di Wu and Jun Wang}, year = {2024}, url = {https://arxiv.org/abs/2403.17312}, note = {Source identifier: 2403.17312} }