@misc{indiciaed6f925fc5d2b, title = {BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization}, author = {Chaoya Jiang and Haiyang Xu and Wei Ye and Qinghao Ye and Chenliang Li and Ming Yan and Bin Bi and Shikun Zhang and Fei Huang and Songfang Huang}, year = {2024}, url = {https://arxiv.org/abs/2307.08504}, note = {Source identifier: 2307.08504} }