@misc{indiciae225e68a5f0cd, title = {SpecOffload: Unlocking Latent GPU Capacity for LLM Inference on Resource-Constrained Devices}, author = {Xiangwen Zhuge and Xu Shen and Zeyu Wang and Fan Dang and Xuan Ding and Danyang Li and Yahui Han and Tianxiang Hao and Zheng Yang}, year = {2025}, url = {https://arxiv.org/abs/2505.10259}, note = {Source identifier: 2505.10259} }