@misc{indiciaeb76389669e81, title = {EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model}, author = {Yuxuan Zhang and Tianheng Cheng and Lianghui Zhu and Rui Hu and Lei Liu and Heng Liu and Longjin Ran and Xiaoxin Chen and Wenyu Liu and Xinggang Wang}, year = {2025}, url = {https://arxiv.org/abs/2406.20076}, note = {Source identifier: 2406.20076} }