@misc{indiciae52d1a56fe3da, title = {Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding}, author = {Pengchuan Zhang and Xiyang Dai and Jianwei Yang and Bin Xiao and Lu Yuan and Lei Zhang and Jianfeng Gao}, year = {2021}, url = {https://arxiv.org/abs/2103.15358}, note = {Source identifier: 2103.15358} }