@misc{indiciae1e223faa4680, title = {LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning}, author = {Jiangyong Huang and Xiaojian Ma and Xiongkun Linghu and Junchao He and Qing Li and Song-Chun Zhu and Yixin Chen and Baoxiong Jia and Siyuan Huang}, year = {2026}, url = {https://arxiv.org/abs/2506.09935}, note = {Source identifier: 2506.09935} }