@misc{indiciae27ff3e682fb4, title = {Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval}, author = {Li-Cheng Shen and Jih-Kang Hsieh and Wei-Hua Li and Chu-Song Chen}, year = {2025}, url = {https://arxiv.org/abs/2506.22864}, note = {Source identifier: 2506.22864} }