@misc{indiciae967a4e419264, title = {S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance}, author = {Di Liu and Yifei Liu and Chen Chen and Zhibin Yu and Xiaoyi Fan and Quan Chen and Minyi Guo}, year = {2026}, url = {https://arxiv.org/abs/2603.10353}, note = {Source identifier: 2603.10353} }