@misc{indiciaedbed37d5c9d2, title = {StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues}, author = {Zanxi Ruan and Songqun Gao and Qiuyu Kong and Yiming Wang and Marco Cristani}, year = {2026}, url = {https://arxiv.org/abs/2602.20089}, note = {Source identifier: 2602.20089} }