@misc{indiciae3beff60c1733, title = {SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation}, author = {Youliang Zhang and Zhaoyang Li and Duomin Wang and Jiahe Zhang and Deyu Zhou and Zixin Yin and Xili Dai and Gang Yu and Xiu Li}, year = {2025}, url = {https://arxiv.org/abs/2507.09862}, note = {Source identifier: 2507.09862} }