@misc{indiciae0971a5afbc16, title = {HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment}, author = {Ruijia Wu and Ping Chen and Fei Shen and Shaoan Zhao and Qiang Hui and Huanlin Gao and Ting Lu and Zhaoxiang Liu and Fang Zhao and Kai Wang and Shiguo Lian}, year = {2025}, url = {https://arxiv.org/abs/2511.06653}, note = {Source identifier: 2511.06653} }