@misc{indiciae719cc41a46c9, title = {Scaling Audio-Text Retrieval with Multimodal Large Language Models}, author = {Jilan Xu and Carl Thomé and Danijela Horak and Weidi Xie and Andrew Zisserman}, year = {2026}, url = {https://arxiv.org/abs/2602.18010}, note = {Source identifier: 2602.18010} }