@misc{indiciae2a3c2d9262f8, title = {Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning}, author = {Wenjie Tian and Mingchen Shao and Bingshen Mu and Xuelong Geng and Chengyou Wang and Yujie Liao and Zhixian Zhao and Ziyu Zhang and Jingbin Hu and Mengqi Wei and Lei Xie}, year = {2026}, url = {https://arxiv.org/abs/2603.07263}, note = {Source identifier: 2603.07263} }