@misc{indiciae2a335d4450fc, title = {SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding}, author = {Haoxiang Wang and Pavan Kumar Anasosalu Vasu and Fartash Faghri and Raviteja Vemulapalli and Mehrdad Farajtabar and Sachin Mehta and Mohammad Rastegari and Oncel Tuzel and Hadi Pouransari}, year = {2024}, url = {https://arxiv.org/abs/2310.15308}, note = {Source identifier: 2310.15308} }