@misc{indiciaeb6c7fea1929c, title = {More GPUs or a Smaller Cache? Tensor Parallelism versus KV Compression for Memory-Bound LLM Serving}, author = {Srikanta Datta Tumkur and Mehar Simhadri and Anshu Bansal and Jay Iyer and Sai Pavan Kumar and Sai Kapil Kumar and Ramesh Nampelly and Raj Dandekar}, year = {2026}, url = {https://arxiv.org/abs/2608.23962}, note = {Source identifier: 2608.23962} }