@misc{indiciae9a28b10adf71, title = {Grounding Language Models to Images for Multimodal Inputs and Outputs}, author = {Jing Yu Koh and Ruslan Salakhutdinov and Daniel Fried}, year = {2023}, url = {https://arxiv.org/abs/2301.13823}, note = {Source identifier: 2301.13823} }