TY - RPRT TI - Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models AU - Chuofan Ma AU - Yi Jiang AU - Jiannan Wu AU - Zehuan Yuan AU - Xiaojuan Qi PY - 2024 UR - https://arxiv.org/abs/2404.13013 ID - 2404.13013 ER -