@misc{indiciae6acc383629d7, title = {Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation}, author = {Wenliang Dai and Lu Hou and Lifeng Shang and Xin Jiang and Qun Liu and Pascale Fung}, year = {2022}, url = {https://arxiv.org/abs/2203.06386}, note = {Source identifier: 2203.06386} }