@misc{indiciaeb121d22440a8, title = {A Progressive Framework of Vision-language Knowledge Distillation and Alignment for Multilingual Scene}, author = {Wenbo Zhang and Yifan Zhang and Jianfeng Lin and Binqiang Huang and Jinlu Zhang and Wenhao Yu}, year = {2024}, url = {https://arxiv.org/abs/2404.11249}, note = {Source identifier: 2404.11249} }