@misc{indiciae7cf26839afec, title = {I2TTS: Image-indicated Immersive Text-to-speech Synthesis with Spatial Perception}, author = {Jiawei Zhang and Tian-Hao Zhang and Jun Wang and Jiaran Gao and Xinyuan Qian and Xu-Cheng Yin}, year = {2025}, url = {https://arxiv.org/abs/2411.13314}, note = {Source identifier: 2411.13314} }