@misc{indiciae51af49fa7f3a, title = {How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing}, author = {Huanyu Zhang and Xuehai Bai and Chengzu Li and Chen Liang and Haochen Tian and Haodong Li and Ruichuan An and Yifan Zhang and Anna Korhonen and Zhang Zhang and Liang Wang and Tieniu Tan}, year = {2026}, url = {https://arxiv.org/abs/2602.01851}, note = {Source identifier: 2602.01851} }