@misc{indiciae42ca18af5852, title = {VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task}, author = {Yuyue Wang and Xin Cheng and Yihan Wu and Xihua Wang and Jinchuan Tian and Ruihua Song}, year = {2025}, url = {https://arxiv.org/abs/2511.22229}, note = {Source identifier: 2511.22229} }