@misc{indiciaeeaf1bdf8222e, title = {ToFu: Visual Tokens Reduction via Fusion for Multi-modal, Multi-patch, Multi-image Task}, author = {Vittorio Pippi and Matthieu Guillaumin and Silvia Cascianelli and Rita Cucchiara and Maximilian Jaritz and Loris Bazzani}, year = {2025}, url = {https://arxiv.org/abs/2503.04444}, note = {Source identifier: 2503.04444} }