@article{multimodalreferencelearningforfine, title = {Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval}, author = {Zehong Ma and Hao Chen and Wei Zeng and Limin Su and Shiliang Zhang}, year = {2025}, eprint = {2504.07718}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2504.07718v1}, }