@misc{indiciae64afd3dcce1e, title = {Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion}, author = {Zhan Jin and Bang Zeng and Peijun Yang and Jiarong Du and Wei Ju and Yao Tian and Juan Liu and Ming Li}, year = {2026}, url = {https://arxiv.org/abs/2509.12583}, note = {Source identifier: 2509.12583} }