@misc{indiciae328106f7abd9, title = {Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models}, author = {Songtao Jiang and Yan Zhang and Chenyi Zhou and Yeying Jin and Yang Feng and Jian Wu and Zuozhu Liu}, year = {2024}, url = {https://arxiv.org/abs/2404.04514}, note = {Source identifier: 2404.04514} }