@misc{indiciae5dfc931c67fa, title = {AV-SepFormer: Cross-Attention SepFormer for Audio-Visual Target Speaker Extraction}, author = {Jiuxin Lin and Xinyu Cai and Heinrich Dinkel and Jun Chen and Zhiyong Yan and Yongqing Wang and Junbo Zhang and Zhiyong Wu and Yujun Wang and Helen Meng}, year = {2023}, url = {https://arxiv.org/abs/2306.14170}, note = {Source identifier: 2306.14170} }