TY - RPRT TI - LLaMCAT: Optimizing Large Language Model Inference with Cache Arbitration and Throttling AU - Zhongchun Zhou AU - Chengtao Lai AU - Wei Zhang PY - 2025 DO - 10.1145/3754598.3754671 UR - https://arxiv.org/abs/2512.00083 ID - 2512.00083 ER -