TY - RPRT TI - Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity AU - Da Ma AU - Lu Chen AU - Situo Zhang AU - Yuxun Miao AU - Su Zhu AU - Zhi Chen AU - Hongshen Xu AU - Hanqi Li AU - Shuai Fan AU - Lei Pan AU - Kai Yu PY - 2025 UR - https://arxiv.org/abs/2412.02252 ID - 2412.02252 ER -