paper-with-me

Zero-Shot Cross-Modal Retrieval

3개 벤치마크 · 논문 28편 · 이 태스크의 논문 보기 →

Benchmarks

Flickr30k

결과 22개

COCO 2014

결과 18개

IMPACT Patent

결과 1개

Most implemented

Papers

MatBind: A Shared Embedding Space for Multimodal Materials Characterization

2026-07-09 · Le Yang, Anoop K. Chandran, Jona Östreicher, Evgenii Sovetkin 외 arxiv

Fully characterizing a crystalline material requires integrating heterogeneous data sources -- atomic structures, diffraction patterns, electronic density of states, and natural language -- each of which captures a diffe…

Zero-Shot Cross-Modal RetrievalContrastive Learning

STAR: Semantic-Traffic Alignment and Retrieval for Zero-Shot HTTPS Website Fingerprinting

2025-12-19 · Yifei Cheng, Yujia Zhu, Baiyang Li, Xinhao Deng 외 arxiv

Modern HTTPS mechanisms such as Encrypted Client Hello (ECH) and encrypted DNS improve privacy but remain vulnerable to website fingerprinting (WF) attacks, where adversaries infer visited sites from encrypted traffic pa…

Zero-Shot Cross-Modal Retrieval

FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs

2025-04-02 · CVPR 2025 1 · Mothilal Asokan, Kebin Wu, Fatima Albreiki

As a pioneering vision-language model, CLIP (Contrastive Language-Image Pre-training) has achieved significant success across various domains and a wide range of downstream vision-language tasks. However, the text encode…

cross-modal alignmentCross-Modal RetrievalImage GenerationText to Image Generation+2

A Recipe for Improving Remote Sensing VLM Zero Shot Generalization

2025-03-10 · Aviad Barzilai, Yotam Gigi, Vered Silverman, Yehonathan Refael 외

Foundation models have had a significant impact across various AI applications, enabling use cases that were previously impossible. Contrastive Visual Language Models (VLMs), in particular, have outperformed other techni…

Cross-Modal RetrievalZero-Shot Cross-Modal RetrievalZero-shot Generalization

IMPACT: A Large-scale Integrated Multimodal Patent Analysis and Creation Dataset for Design Patents

2024-12-10 · NeurIPS 2024 12 · Homaira Huda Shomee, Zhu Wang, Sathya N. Ravi, Sourav Medya

In this paper, we introduce IMPACT (Integrated Multimodal Patent Analysis and Creation Dataset for Design Patents), a large-scale multimodal patent dataset with detailed captions for design patent figures. Our dataset in…

Cross-Modal RetrievalImage ClassificationImage RetrievalPatent classification+5

COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training

2024-12-02 · CVPR 2025 1 · Sanghwan Kim, Rui Xiao, Mariana-Iuliana Georgescu, Stephan Alaniz 외

Vision-Language Models (VLMs) trained with contrastive loss have achieved significant advancements in various vision and language tasks. However, the global nature of the contrastive loss makes VLMs focus predominantly o…

Self-Supervised LearningSemantic SegmentationUnsupervised Semantic Segmentation with Language-image Pre-trainingZero-Shot Cross-Modal Retrieval+1

전체 28편 보기 →