TY - RPRT TI - Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured Sparsity AU - Haojun Xia AU - Zhen Zheng AU - Yuchao Li AU - Donglin Zhuang AU - Zhongzhu Zhou AU - Xiafei Qiu AU - Yong Li AU - Wei Lin AU - Shuaiwen Leon Song PY - 2023 UR - https://arxiv.org/abs/2309.10285 ID - 2309.10285 ER -