TY - RPRT TI - ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models AU - Jieyu Zhang AU - Le Xue AU - Linxin Song AU - Jun Wang AU - Weikai Huang AU - Manli Shu AU - An Yan AU - Zixian Ma AU - Juan Carlos Niebles AU - Silvio Savarese AU - Caiming Xiong AU - Zeyuan Chen AU - Ranjay Krishna AU - Ran Xu PY - 2024 UR - https://arxiv.org/abs/2412.07012 ID - 2412.07012 ER -