TY - RPRT TI - Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data AU - Haoxin Li AU - Boyang Li PY - 2025 UR - https://arxiv.org/abs/2503.01167 ID - 2503.01167 ER -