@misc{indiciaea506674756c9, title = {VideoXum: Cross-modal Visual and Textural Summarization of Videos}, author = {Jingyang Lin and Hang Hua and Ming Chen and Yikang Li and Jenhao Hsiao and Chiuman Ho and Jiebo Luo}, year = {2024}, url = {https://arxiv.org/abs/2303.12060}, note = {Source identifier: 2303.12060} }