@misc{indiciaea7728b2f40dd, title = {Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models}, author = {Guangzhi Sun and Wenyi Yu and Changli Tang and Xianzhao Chen and Tian Tan and Wei Li and Lu Lu and Zejun Ma and Chao Zhang}, year = {2023}, url = {https://arxiv.org/abs/2310.05863}, note = {Source identifier: 2310.05863} }