@misc{indiciae15b4c2a7ad2a, title = {Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers}, author = {Yuxin Wen and Qingqing Cao and Qichen Fu and Sachin Mehta and Mahyar Najibi}, year = {2024}, url = {https://arxiv.org/abs/2410.14072}, note = {Source identifier: 2410.14072} }