@misc{indiciae2ada7dd0dca2, title = {Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models}, author = {Jing-Xuan Zhang and Genshun Wan and Jianqing Gao and Zhen-Hua Ling}, year = {2025}, url = {https://arxiv.org/abs/2502.05766}, note = {Source identifier: 2502.05766} }