@misc{indiciaee6f55224859f, title = {Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving}, author = {Zihan Zhao and Baotong Lu and Shengjie Lin and Yizou Chen and Jing Liu and Yanqi Zhang and Ziming Miao and Ming-Chang Yang and Haiying Shen and Qi Chen and Fan Yang}, year = {2026}, url = {https://arxiv.org/abs/2604.26837}, note = {Source identifier: 2604.26837} }