@misc{indiciae141a3a00de16, title = {I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs}, author = {Yu Qi and Lipeng Gu and Honghua Chen and Liangliang Nan and Mingqiang Wei}, year = {2025}, url = {https://arxiv.org/abs/2506.14495}, note = {Source identifier: 2506.14495} }