@misc{indiciae019ed4d21baa, title = {Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models}, author = {Yu Zeng and Wenxuan Huang and Zhen Fang and Shuang Chen and Yufan Shen and Yishuo Cai and Xiaoman Wang and Zhenfei Yin and Lin Chen and Zehui Chen and Shiting Huang and Yiming Zhao and Xu Tang and Yao Hu and Philip Torr and Wanli Ouyang and Shaosheng Cao}, year = {2026}, url = {https://arxiv.org/abs/2602.02185}, note = {Source identifier: 2602.02185} }