@misc{indiciae88f3a3159759, title = {Dense Multimodal Alignment for Open-Vocabulary 3D Scene Understanding}, author = {Ruihuang Li and Zhengqiang Zhang and Chenhang He and Zhiyuan Ma and Vishal M. Patel and Lei Zhang}, year = {2024}, url = {https://arxiv.org/abs/2407.09781}, note = {Source identifier: 2407.09781} }