@misc{indiciae184533ad8403, title = {Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment}, author = {Yuze Zheng and Zixuan Li and Xiangxian Li and Jinxing Liu and Yuqing Wang and Xiangxu Meng and Lei Meng}, year = {2024}, url = {https://arxiv.org/abs/2407.18854}, note = {Source identifier: 2407.18854} }