paper-with-me

Image-to-Text Retrieval

8개 벤치마크 · 논문 66편 · 이 태스크의 논문 보기 →

Benchmarks

Flickr30k

결과 11개

WHOOPS!

결과 7개

AIC-ICC

결과 2개

COCO

결과 1개

FETA Car-Manuals

결과 1개

RSICD

결과 1개

RUC-CAS-WenLan

결과 1개

Most implemented

Papers

OrganLens: Organ-Specific Representation Learning for CT Foundation Models

2026-07-28 · Zhixuan Ge, Anqi Li, Sadeer Al-Kindi, Hanwen Xu 외 arxiv

A CT examination captures multiple organs, but many biomedical questions concern abnormalities, prognosis, or longitudinal change in a specific organ. These questions require a separate representation for each organ with…

Representation LearningImage-to-Text Retrieval

One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness

2026-04-30 · Hiroyuki Deguchi, Katsuki Chousa, Yusuke Sakai arxiv

The hubness problem, in which hub embeddings are close to many unrelated examples, occurs often in high-dimensional embedding spaces and may pose a practical threat for purposes such as information retrieval and automati…

Image-to-Text RetrievalInformation RetrievalImage Captioning

Negative Entity Suppression for Zero-Shot Captioning with Synthetic Images

2025-11-12 · Zimao Lu, Hui Xu, Bing Liu, Ke Wang arxiv

Text-only training provides an attractive approach to address data scarcity challenges in zero-shot image captioning (ZIC), avoiding the expense of collecting paired image-text annotations. However, although these approa…

Image-to-Text RetrievalDomain GeneralizationImage Captioning

Evaluating Perspectival Biases in Cross-Modal Retrieval

2025-10-30 · Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot 외 arxiv

Multimodal retrieval systems are expected to operate in a semantic space, agnostic to the language or cultural origin of the query. In practice, however, retrieval outcomes systematically reflect perspectival biases: dev…

Representation LearningImage-to-Text RetrievalCross-Modal RetrievalImage Retrieval

DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts

2025-10-28 · Binbin Li, Guimiao Yang, Zisen Qi, Haiping Wang 외 arxiv

Recent lightweight retrieval-augmented image caption models often utilize retrieved data solely as text prompts, thereby creating a semantic gap by leaving the original visual features unenhanced, particularly for object…

Image-to-Text RetrievalImage CaptioningImage Retrieval

Meta CLIP 2: A Worldwide Scaling Recipe

2025-07-29 · Yung-Sung Chuang, Yang Li, Dong Wang, Ching-Feng Yeh 외 arxiv

Contrastive Language-Image Pretraining (CLIP) is a popular foundation model, supporting from zero-shot classification, retrieval to encoders for multimodal large language models (MLLMs). Although CLIP is successfully tra…

Image-to-Text Retrieval

전체 66편 보기 →