@article{vocabularyfreefinegrainedvisualrecogniti, title = {Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model}, author = {Dmitry Demidov and Zaigham Zaheer and Omkar Thawakar and Salman Khan and Fahad Shahbaz Khan}, year = {2025}, eprint = {2507.23070}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2507.23070}, }