@misc{indiciaec7914faa2374, title = {Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding}, author = {Di Wu and Liting Jiang and Ruiyu Fang and Bianjing and Hongyan Xie and Haoxiang Su and Hao Huang and Zhongjiang He and Shuangyong Song and Xuelong Li}, year = {2025}, url = {https://arxiv.org/abs/2511.19005}, note = {Source identifier: 2511.19005} }