@misc{indiciae080dafe9dfa8, title = {Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet}, author = {Li Yuan and Yunpeng Chen and Tao Wang and Weihao Yu and Yujun Shi and Zihang Jiang and Francis EH Tay and Jiashi Feng and Shuicheng Yan}, year = {2021}, url = {https://arxiv.org/abs/2101.11986}, note = {Source identifier: 2101.11986} }