@misc{indiciaeaf83f2110d84, title = {A Challenging Multimodal Video Summary: Simultaneously Extracting and Generating Keyframe-Caption Pairs from Video}, author = {Keito Kudo and Haruki Nagasawa and Jun Suzuki and Nobuyuki Shimizu}, year = {2023}, url = {https://arxiv.org/abs/2312.01575}, note = {Source identifier: 2312.01575} }