TY - RPRT TI - Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation AU - Xilin Jiang AU - Junkai Wu AU - Vishal Choudhari AU - Nima Mesgarani PY - 2025 UR - https://arxiv.org/abs/2505.06803 ID - 2505.06803 ER -