@misc{indiciaef1f71bd2f8be, title = {SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization}, author = {Tan-Hanh Pham and Hoang-Nam Le and Phu-Vinh Nguyen and Chris Ngo and Truong-Son Hy}, year = {2024}, url = {https://arxiv.org/abs/2412.16771}, note = {Source identifier: 2412.16771} }