@misc{indiciae2674f2b8da67, title = {Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval}, author = {Ruofan Hu and Yan Xia and Minjie Hong and Jieming Zhu and Bo Chen and Xiaoda Yang and Minghui Fang and Tao Jin}, year = {2025}, url = {https://arxiv.org/abs/2506.14445}, note = {Source identifier: 2506.14445} }