@misc{indiciae74be5a6a20d5, title = {Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders}, author = {Shang-Jui Ray Kuo and Paola Cascante-Bonilla}, year = {2026}, url = {https://arxiv.org/abs/2603.19209}, note = {Source identifier: 2603.19209} }