@misc{indiciaef6dd76ba5e81, title = {Draft \& Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding}, author = {Jun Zhang and Jue Wang and Huan Li and Lidan Shou and Ke Chen and Gang Chen and Sharad Mehrotra}, year = {2024}, doi = {10.18653/v1/2024.acl-long.607}, url = {https://arxiv.org/abs/2309.08168}, note = {Source identifier: 2309.08168} }