Phrase Grounding
5개 벤치마크 · 논문 98편 · 이 태스크의 논문 보기 →
Benchmarks
Flickr30k Entities Test
Flickr30k
Flickr30k Entities Dev
ReferIt
Visual Genome
Most implemented
Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding
MDETR -- Modulated Detection for End-to-End Multi-Modal Understanding
Towards Visual Grounding: A Survey
Revisiting Image-Language Networks for Open-ended Phrase Detection
Grounding of Textual Phrases in Images by Reconstruction
Vision-Language Grounding as Bidirectional Concept Correspondence
Papers
Vision-Language Grounding as Bidirectional Concept Correspondence
Vision-language grounding connects language to visual content, yet most existing formulations reduce grounding to a unidirectional localization problem: given a prespecified text phrase or category name, identify the cor…
Referring ExpressionImage SegmentationPhrase GroundingLocation-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models
Fine-grained visual representations are essential for medical image analysis, particularly when diagnostically relevant evidence is subtle and spatially localized. Modern transformer-based medical vision encoders must th…
Visual Question AnsweringSelf-Supervised LearningRepresentation LearningPhrase GroundingLoFi: Location-Aware Fine-Grained Representation Learning for Chest X-ray
Fine-grained representation learning is crucial for retrieval and phrase grounding in chest X-rays, where clinically relevant findings are often spatially confined. However, the lack of region-level supervision in contra…
Representation LearningDense CaptioningPhrase GroundingLLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing
Most existing CLIP-style medical vision--language pretraining methods rely on global or local alignment with substantial paired data. However, global alignment is easily dominated by non-diagnostic information, while loc…
Phrase GroundingText RetrievalCURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation
Medical vision-language models can automate the generation of radiology reports but struggle with accurate visual grounding and factual consistency. Existing models often misalign textual findings with visual evidence, l…
Visual GroundingPhrase GroundingAnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation
Multimodal medical large language models have shown substantial progress in chest X-ray interpretation but continue to face challenges in spatial reasoning and anatomical understanding. Although existing grounding techni…
Visual Question AnsweringSpatial ReasoningPhrase Grounding