paper-with-me

Visual Dialog

8개 벤치마크 · 논문 120편 · 이 태스크의 논문 보기 →

Benchmarks

VisDial v0.9 val

결과 36개

VisDial v1.0 test-std

결과 6개

BlendedSkillTalk

결과 2개

ConvAI2

결과 2개

EmpatheticDialogues

결과 2개

Image-Chat

결과 2개

Wizard of Wikipedia

결과 2개

Most implemented

Visual Dialog

2016-11-26 · 구현 11개

Papers

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

2026-07-30 · Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen 외 arxiv

Due to their strong generalizable multimodal processing and reasoning capabilities, Multimodal Large Language Models (MLLMs) have demonstrated significant potential as universal image retrievers, effectively addressing d…

Image RetrievalVisual Dialog

Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments

2026-05-20 · Van Quang Nguyen arxiv

Advancements at the intersection of computer vision and natural language processing are crucial for applications like assistive tech, multimedia querying, and robotics. This dissertation proposes novel architectures to i…

Instruction FollowingImage CaptioningVisual Dialog

V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts

2025-03-03 · Adnen Abdessaied, Anna Rohrbach, Marcus Rohrbach, Andreas Bulling

We present V$^2$Dial - a novel expert-based model specifically geared towards simultaneously handling image and video input data for multimodal conversational tasks. Current multimodal models primarily focus on simpler t…

Contrastive LearningText RetrievalVideo-Text RetrievalVisual Dialog+1

V^2Dial: Unification of Video and Visual Dialog via Multimodal Experts

2025-01-01 · CVPR 2025 1 · Adnen Abdessaied, Anna Rohrbach, Marcus Rohrbach, Andreas Bulling

We present V2Dial - a novel expert-based model specifically geared towards simultaneously handling image and video input data for multimodal conversational tasks. Current multimodal models primarily focus on simpler …

Contrastive LearningText RetrievalVideo-Text RetrievalVisual Dialog+1

Enhancing Visual Dialog State Tracking through Iterative Object-Entity Alignment in Multi-Round Conversations

2024-08-13 · Wei Pang, Ruixue Duan, Jinfu Yang, Ning li

Visual Dialog (VD) is a task where an agent answers a series of image-related questions based on a multi-round dialog history. However, previous VD methods often treat the entire dialog history as a simple text input, di…

dialog state trackingDialogue State TrackingEntity AlignmentVisual Dialog

ICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report

2024-07-13 · Yixiao Yuan, Yingzhe Peng

The Visual-Dialog Based Emotion Explanation Generation Challenge focuses on generating emotion explanations through visual-dialog interactions in art discussions. Our approach combines state-of-the-art multi-modal models…

Explanation GenerationLanguage ModelingLanguage ModellingVisual Dialog

전체 120편 보기 →