TY - RPRT TI - HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding AU - Jiaxing Zhao AU - Qize Yang AU - Yixing Peng AU - Detao Bai AU - Shimin Yao AU - Boyuan Sun AU - Xiang Chen AU - Shenghao Fu AU - Weixuan chen AU - Xihan Wei AU - Liefeng Bo PY - 2025 UR - https://arxiv.org/abs/2501.15111 ID - 2501.15111 ER -