TY - RPRT TI - Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels? AU - Xiujun Li AU - Yujie Lu AU - Zhe Gan AU - Jianfeng Gao AU - William Yang Wang AU - Yejin Choi PY - 2024 UR - https://arxiv.org/abs/2311.17647 ID - 2311.17647 ER -