@misc{indiciae3d8b605a788a, title = {VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization}, author = {Dingyu Yao and Chenxu Yang and Zhengyang Tong and Zheng Lin and Wei Liu and Jian Luan and Weiping Wang}, year = {2025}, url = {https://arxiv.org/abs/2510.06175}, note = {Source identifier: 2510.06175} }