TY - RPRT TI - Vision-language models lag human performance on physical dynamics and intent reasoning AU - Tianjun Gu AU - Jingyu Gong AU - Zhizhong Zhang AU - Yuan Xie AU - Lizhuang Ma AU - Xin Tan AU - Athanasios V PY - 2026 UR - https://arxiv.org/abs/2601.01547 ID - 2601.01547 ER -