@misc{indiciaea4cb11794230, title = {AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning}, author = {Daning Zhang and Ying Wei}, year = {2025}, url = {https://arxiv.org/abs/2507.12972}, note = {Source identifier: 2507.12972} }