@misc{indiciae87ed4fd588b6, title = {VLM3: Vision Language Models Are Native 3D Learners}, author = {Zhipeng Cai and Zhuang Liu and Yunyang Xiong and Zechun Liu and Vikas Chandra and Yangyang Shi}, year = {2026}, url = {https://arxiv.org/abs/2605.30561}, note = {Source identifier: 2605.30561} }