@misc{indiciae3fd0eb9d8fb7, title = {SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding}, author = {Liangtao Shi and Ting Liu and Xiantao Hu and Yue Hu and Quanjun Yin and Richang Hong}, year = {2025}, url = {https://arxiv.org/abs/2502.16786}, note = {Source identifier: 2502.16786} }