@misc{indiciaeb408da143932, title = {GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer}, author = {Ding Jia and Jianyuan Guo and Kai Han and Han Wu and Chao Zhang and Chang Xu and Xinghao Chen}, year = {2024}, url = {https://arxiv.org/abs/2406.01210}, note = {Source identifier: 2406.01210} }