@misc{indiciaec03ab53338ac, title = {ViLA: Efficient Video-Language Alignment for Video Question Answering}, author = {Xijun Wang and Junbang Liang and Chun-Kai Wang and Kenan Deng and Yu Lou and Ming Lin and Shan Yang}, year = {2024}, url = {https://arxiv.org/abs/2312.08367}, note = {Source identifier: 2312.08367} }