@misc{indiciaead7c9b514b18, title = {Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering}, author = {Ting Yu and Kunhao Fu and Jian Zhang and Qingming Huang and Jun Yu}, year = {2024}, doi = {10.1109/tip.2024.3390984}, url = {https://arxiv.org/abs/2410.09379}, note = {Source identifier: 2410.09379} }