@misc{indiciae88729f10a24d, title = {VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text}, author = {Tianyu Zhang and Suyuchen Wang and Lu Li and Ge Zhang and Perouz Taslakian and Sai Rajeswar and Jie Fu and Bang Liu and Yoshua Bengio}, year = {2025}, url = {https://arxiv.org/abs/2406.06462}, note = {Source identifier: 2406.06462} }