@misc{indiciaeed388b35a197, title = {Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization}, author = {Ming Cheng and Ming Li}, year = {2025}, url = {https://arxiv.org/abs/2401.08052}, note = {Source identifier: 2401.08052} }