@misc{indiciae4fdd8e108492, title = {UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts}, author = {Zhi-Qi Cheng and Xiang Li and Jun-Yan He and Junyao Chen and Xiaomao Fan and Xiaojiang Peng and Alexander G. Hauptmann}, year = {2025}, url = {https://arxiv.org/abs/2404.18398}, note = {Source identifier: 2404.18398} }