@misc{indiciaecf40c8fc2c9f, title = {World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering}, author = {Jiacong Wang and Bohong Wu and Haiyong Jiang and Xun Zhou and Xin Xiao and Haoyuan Guo and Jun Xiao}, year = {2024}, url = {https://arxiv.org/abs/2409.20424}, note = {Source identifier: 2409.20424} }