@misc{indiciae29b596a85d1e, title = {Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation}, author = {Xilin Jiang and Junkai Wu and Vishal Choudhari and Nima Mesgarani}, year = {2025}, url = {https://arxiv.org/abs/2505.06803}, note = {Source identifier: 2505.06803} }