@misc{indiciae6f19b96074e8, title = {Cross-Modal Learning for Music-to-Music-Video Description Generation}, author = {Zhuoyuan Mao and Mengjie Zhao and Qiyu Wu and Zhi Zhong and Wei-Hsiang Liao and Hiromi Wakaki and Yuki Mitsufuji}, year = {2025}, url = {https://arxiv.org/abs/2503.11190}, note = {Source identifier: 2503.11190} }