@misc{indiciaee78dca4b6d43, title = {Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection}, author = {Wenhuan Lu and Xinyue Song and Wenjun Ke and Zhizhi Yu and Wenhao Yang and Jianguo Wei}, year = {2025}, url = {https://arxiv.org/abs/2509.16670}, note = {Source identifier: 2509.16670} }