@misc{indiciaeac468c4afcb7, title = {Can Large Vision-Language Models Correct Semantic Grounding Errors By Themselves?}, author = {Yuan-Hong Liao and Rafid Mahmood and Sanja Fidler and David Acuna}, year = {2025}, url = {https://arxiv.org/abs/2404.06510}, note = {Source identifier: 2404.06510} }