@misc{indiciae1a98e219b9e0, title = {Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models}, author = {Chuofan Ma and Yi Jiang and Jiannan Wu and Zehuan Yuan and Xiaojuan Qi}, year = {2024}, url = {https://arxiv.org/abs/2404.13013}, note = {Source identifier: 2404.13013} }