TY - RPRT TI - Embodied Scene Understanding for Vision Language Models via MetaVQA AU - Weizhen Wang AU - Chenda Duan AU - Zhenghao Peng AU - Yuxin Liu AU - Bolei Zhou PY - 2025 UR - https://arxiv.org/abs/2501.09167 ID - 2501.09167 ER -