@misc{indiciaeadd98b3cc54c, title = {An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models}, author = {Zizhao Hu and Shaochong Jia and Mohammad Rostami}, year = {2024}, url = {https://arxiv.org/abs/2403.16530}, note = {Source identifier: 2403.16530} }