@misc{indiciae1535274b21b7, title = {Efficient End-to-End Video Question Answering with Pyramidal Multimodal Transformer}, author = {Min Peng and Chongyang Wang and Yu Shi and Xiang-Dong Zhou}, year = {2023}, url = {https://arxiv.org/abs/2302.02136}, note = {Source identifier: 2302.02136} }