@misc{indiciaed6c0d1cb2969, title = {Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning}, author = {Shaofeng Yin and Jiaxin Ge and Zora Zhiruo Wang and Chenyang Wang and Xiuyu Li and Michael J. Black and Trevor Darrell and Angjoo Kanazawa and Haiwen Feng}, year = {2026}, url = {https://arxiv.org/abs/2601.11109}, note = {Source identifier: 2601.11109} }