@misc{indiciae26d32057b817, title = {VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings}, author = {Ramin Giahi and Kehui Yao and Sriram Kollipara and Kai Zhao and Vahid Mirjalili and Jianpeng Xu and Topojoy Biswas and Evren Korpeoglu and Kannan Achan}, year = {2025}, url = {https://arxiv.org/abs/2507.17080}, note = {Source identifier: 2507.17080} }