@misc{indiciaede2cd6c1fb4c, title = {Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning}, author = {Bonan li and Zicheng Zhang and Songhua Liu and Weihao Yu and Xinchao Wang}, year = {2025}, url = {https://arxiv.org/abs/2505.11945}, note = {Source identifier: 2505.11945} }