@misc{indiciae8f717e2b456f, title = {EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions}, author = {Kai Chen and Yunhao Gou and Runhui Huang and Zhili Liu and Daxin Tan and Jing Xu and Chunwei Wang and Yi Zhu and Yihan Zeng and Kuo Yang and Dingdong Wang and Kun Xiang and Haoyuan Li and Haoli Bai and Jianhua Han and Xiaohui Li and Weike Jin and Nian Xie and Yu Zhang and James T. Kwok and Hengshuang Zhao and Xiaodan Liang and Dit-Yan Yeung and Xiao Chen and Zhenguo Li and Wei Zhang and Qun Liu and Jun Yao and Lanqing Hong and Lu Hou and Hang Xu}, year = {2025}, url = {https://arxiv.org/abs/2409.18042}, note = {Source identifier: 2409.18042} }