@misc{indiciaed4d14523768e, title = {Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data}, author = {Haoxin Li and Boyang Li}, year = {2025}, url = {https://arxiv.org/abs/2503.01167}, note = {Source identifier: 2503.01167} }