@misc{indiciaecd2aacb7e8ab, title = {LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning}, author = {Yifan Dai and Zhenhua Wu and Bohan Zeng and Daili Hua and Jialing Liu and Bozhou Li and Yuran Wang and Chengzhuo Tong and Hao Liang and Xiaochen Ma and Junbo Niu and Tianyu Guo and Yang Shi and Yue Ding and Yiyan Ji and Bingyin Mei and Yushuo Guan and Yuanxing Zhang and Pengfei Wan and Fangcheng Fu and Wentao Zhang}, year = {2026}, url = {https://arxiv.org/abs/2605.22012}, note = {Source identifier: 2605.22012} }