@misc{indiciae7b68a20d6d61, title = {Optimizing LLM Inference Throughput via Memory-aware and SLA-constrained Dynamic Batching}, author = {Bowen Pang and Kai Li and Feifan Wang}, year = {2025}, url = {https://arxiv.org/abs/2503.05248}, note = {Source identifier: 2503.05248} }