@misc{indiciae8bdf517cb3b5, title = {Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos}, author = {Jiajun Fei and Dian Li and Zhidong Deng and Zekun Wang and Gang Liu and Hui Wang}, year = {2024}, url = {https://arxiv.org/abs/2408.14023}, note = {Source identifier: 2408.14023} }