@misc{indiciae391e09c2cc3e, title = {An Empirical Study of Training End-to-End Vision-and-Language Transformers}, author = {Zi-Yi Dou and Yichong Xu and Zhe Gan and Jianfeng Wang and Shuohang Wang and Lijuan Wang and Chenguang Zhu and Pengchuan Zhang and Lu Yuan and Nanyun Peng and Zicheng Liu and Michael Zeng}, year = {2022}, url = {https://arxiv.org/abs/2111.02387}, note = {Source identifier: 2111.02387} }