@misc{indiciae8786b8ae0f8b, title = {SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering}, author = {Bingxin Li}, year = {2025}, url = {https://arxiv.org/abs/2504.01049}, note = {Source identifier: 2504.01049} }