@misc{indiciaeaa0b8148a1a4, title = {Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics}, author = {Jiahua Wang and Leqi Zheng and Jialong Wu and Yaoxin Mao and Shijie Cheng}, year = {2026}, url = {https://arxiv.org/abs/2512.00883}, note = {Source identifier: 2512.00883} }