TY - RPRT TI - SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering AU - Bingxin Li PY - 2025 UR - https://arxiv.org/abs/2504.01049 ID - 2504.01049 ER -