@misc{indiciae9f3917bcfaf6, title = {Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization}, author = {Luyao Cheng and Hui Wang and Siqi Zheng and Yafeng Chen and Rongjie Huang and Qinglin Zhang and Qian Chen and Xihao Li}, year = {2024}, url = {https://arxiv.org/abs/2408.12102}, note = {Source identifier: 2408.12102} }