@misc{indiciae76c68fb2b143, title = {Vision-language models lag human performance on physical dynamics and intent reasoning}, author = {Tianjun Gu and Jingyu Gong and Zhizhong Zhang and Yuan Xie and Lizhuang Ma and Xin Tan and Athanasios V}, year = {2026}, url = {https://arxiv.org/abs/2601.01547}, note = {Source identifier: 2601.01547} }