TY - RPRT TI - More GPUs or a Smaller Cache? Tensor Parallelism versus KV Compression for Memory-Bound LLM Serving AU - Srikanta Datta Tumkur AU - Mehar Simhadri AU - Anshu Bansal AU - Jay Iyer AU - Sai Pavan Kumar AU - Sai Kapil Kumar AU - Ramesh Nampelly AU - Raj Dandekar PY - 2026 UR - https://arxiv.org/abs/2608.23962 ID - 2608.23962 ER -