@misc{indiciaed54f7806e84c, title = {Scaling Down, Serving Fast: Compressing and Deploying Efficient LLMs for Recommendation Systems}, author = {Kayhan Behdin and Ata Fatahibaarzi and Qingquan Song and Yun Dai and Aman Gupta and Zhipeng Wang and Shao Tang and Hejian Sang and Gregory Dexter and Sirou Zhu and Siyu Zhu and Tejas Dharamsi and Vignesh Kothapalli and Zhoutong Fu and Yihan Cao and Pin-Lun Hsu and Fedor Borisyuk and Natesh Pillai and Luke Simon and Rahul Mazumder}, year = {2025}, url = {https://arxiv.org/abs/2502.14305}, note = {Source identifier: 2502.14305} }