@misc{indiciaeade1fd2e16dc, title = {Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding}, author = {Kenton Lee and Mandar Joshi and Iulia Turc and Hexiang Hu and Fangyu Liu and Julian Eisenschlos and Urvashi Khandelwal and Peter Shaw and Ming-Wei Chang and Kristina Toutanova}, year = {2023}, url = {https://arxiv.org/abs/2210.03347}, note = {Source identifier: 2210.03347} }