@misc{indiciae7d3634d483c8, title = {Instruction-augmented Multimodal Alignment for Image-Text and Element Matching}, author = {Xinli Yue and JianHui Sun and Junda Lu and Liangchao Yao and Fan Xia and Tianyi Wang and Fengyun Rao and Jing Lyu and Yuetang Deng}, year = {2025}, url = {https://arxiv.org/abs/2504.12018}, note = {Source identifier: 2504.12018} }