@misc{indiciaed4938faa034d, title = {LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference}, author = {Qichen Fu and Minsik Cho and Thomas Merth and Sachin Mehta and Mohammad Rastegari and Mahyar Najibi}, year = {2024}, url = {https://arxiv.org/abs/2407.14057}, note = {Source identifier: 2407.14057} }