@misc{indiciae4bedabf740c0, title = {Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model}, author = {Dmitry Demidov and Zaigham Zaheer and Omkar Thawakar and Salman Khan and Fahad Shahbaz Khan}, year = {2025}, url = {https://arxiv.org/abs/2507.23070}, note = {Source identifier: 2507.23070} }