@misc{indiciae1e7b8f391765, title = {Harnessing Your DRAM and SSD for Sustainable and Accessible LLM Inference with Mixed-Precision and Multi-level Caching}, author = {Jie Peng and Zhang Cao and Huaizhi Qu and Zhengyu Zhang and Chang Guo and Yanyong Zhang and Zhichao Cao and Tianlong Chen}, year = {2024}, url = {https://arxiv.org/abs/2410.14740}, note = {Source identifier: 2410.14740} }