@misc{indiciae90ba17e258f7, title = {GRILL: Grounded Vision-language Pre-training via Aligning Text and Image Regions}, author = {Woojeong Jin and Subhabrata Mukherjee and Yu Cheng and Yelong Shen and Weizhu Chen and Ahmed Hassan Awadallah and Damien Jose and Xiang Ren}, year = {2023}, url = {https://arxiv.org/abs/2305.14676}, note = {Source identifier: 2305.14676} }