@misc{indiciae1cea447631e3, title = {Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines}, author = {Zhixin Zhang and Yiyuan Zhang and Xiaohan Ding and Xiangyu Yue}, year = {2024}, url = {https://arxiv.org/abs/2410.21220}, note = {Source identifier: 2410.21220} }