TY - RPRT TI - StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues AU - Zanxi Ruan AU - Songqun Gao AU - Qiuyu Kong AU - Yiming Wang AU - Marco Cristani PY - 2026 UR - https://arxiv.org/abs/2602.20089 ID - 2602.20089 ER -