TY - RPRT TI - KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization AU - Tianyi Zhang AU - Jonah Yi AU - Zhaozhuo Xu AU - Anshumali Shrivastava PY - 2024 UR - https://arxiv.org/abs/2405.03917 ID - 2405.03917 ER -