@misc{indiciae8689e3715ccf, title = {How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning}, author = {Luyu Yang and Yutong Dai and An Yan and Viraj Prabhu and Ran Xu and Zeyuan Chen}, year = {2026}, url = {https://arxiv.org/abs/2603.24866}, note = {Source identifier: 2603.24866} }