TY - RPRT TI - Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model AU - Dmitry Demidov AU - Zaigham Zaheer AU - Omkar Thawakar AU - Salman Khan AU - Fahad Shahbaz Khan PY - 2025 UR - https://arxiv.org/abs/2507.23070 ID - 2507.23070 ER -