@misc{indiciaed66d1172d3c7, title = {WAVE: Learning Unified \& Versatile Audio-Visual Embeddings with Multimodal LLM}, author = {Changli Tang and Qinfan Xiao and Ke Mei and Tianyi Wang and Fengyun Rao and Chao Zhang}, year = {2026}, url = {https://arxiv.org/abs/2509.21990}, note = {Source identifier: 2509.21990} }