@misc{indiciaefc095a7202de, title = {VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis}, author = {Chengyuan Ma and Jiawei Jin and Ruijie Xiong and Chunxiang Jin and Canxiang Yan and Wenming Yang}, year = {2026}, url = {https://arxiv.org/abs/2602.02591}, note = {Source identifier: 2602.02591} }