TY - RPRT TI - GRILL: Grounded Vision-language Pre-training via Aligning Text and Image Regions AU - Woojeong Jin AU - Subhabrata Mukherjee AU - Yu Cheng AU - Yelong Shen AU - Weizhu Chen AU - Ahmed Hassan Awadallah AU - Damien Jose AU - Xiang Ren PY - 2023 UR - https://arxiv.org/abs/2305.14676 ID - 2305.14676 ER -