@misc{indiciae206fd477e270, title = {HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding}, author = {Jiaxing Zhao and Qize Yang and Yixing Peng and Detao Bai and Shimin Yao and Boyuan Sun and Xiang Chen and Shenghao Fu and Weixuan chen and Xihan Wei and Liefeng Bo}, year = {2025}, url = {https://arxiv.org/abs/2501.15111}, note = {Source identifier: 2501.15111} }