@misc{indiciae125ebbf4eb87, title = {VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework}, author = {Chris Kelly and Luhui Hu and Bang Yang and Yu Tian and Deshun Yang and Cindy Yang and Zaoshan Huang and Zihao Li and Jiayin Hu and Yuexian Zou}, year = {2024}, url = {https://arxiv.org/abs/2403.09027}, note = {Source identifier: 2403.09027} }