@misc{indiciaea3d5dfbf0fa7, title = {CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion}, author = {Shoubin Yu and Jaehong Yoon and Mohit Bansal}, year = {2025}, url = {https://arxiv.org/abs/2402.05889}, note = {Source identifier: 2402.05889} }