TY - RPRT TI - SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding AU - Haoxiang Wang AU - Pavan Kumar Anasosalu Vasu AU - Fartash Faghri AU - Raviteja Vemulapalli AU - Mehrdad Farajtabar AU - Sachin Mehta AU - Mohammad Rastegari AU - Oncel Tuzel AU - Hadi Pouransari PY - 2024 UR - https://arxiv.org/abs/2310.15308 ID - 2310.15308 ER -