Visual Dialog
8개 벤치마크 · 논문 120편 · 이 태스크의 논문 보기 →
Benchmarks
Visual Dialog v1.0 test-std
VisDial v0.9 val
VisDial v1.0 test-std
BlendedSkillTalk
ConvAI2
EmpatheticDialogues
Image-Chat
Wizard of Wikipedia
Most implemented
Visual Dialog
Hierarchical Question-Image Co-Attention for Visual Question Answering
Learning Cooperative Visual Dialog Agents with Deep Reinforcement Learning
Audio Visual Scene-Aware Dialog (AVSD) Challenge at DSTC7
Perceptual Score: What Data Modalities Does Your Model Perceive?
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
Papers
FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval
Due to their strong generalizable multimodal processing and reasoning capabilities, Multimodal Large Language Models (MLLMs) have demonstrated significant potential as universal image retrievers, effectively addressing d…
Image RetrievalVisual DialogMachine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments
Advancements at the intersection of computer vision and natural language processing are crucial for applications like assistive tech, multimedia querying, and robotics. This dissertation proposes novel architectures to i…
Instruction FollowingImage CaptioningVisual DialogV$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts
We present V$^2$Dial - a novel expert-based model specifically geared towards simultaneously handling image and video input data for multimodal conversational tasks. Current multimodal models primarily focus on simpler t…
Contrastive LearningText RetrievalVideo-Text RetrievalVisual Dialog+1V^2Dial: Unification of Video and Visual Dialog via Multimodal Experts
We present V2Dial - a novel expert-based model specifically geared towards simultaneously handling image and video input data for multimodal conversational tasks. Current multimodal models primarily focus on simpler …
Contrastive LearningText RetrievalVideo-Text RetrievalVisual Dialog+1Enhancing Visual Dialog State Tracking through Iterative Object-Entity Alignment in Multi-Round Conversations
Visual Dialog (VD) is a task where an agent answers a series of image-related questions based on a multi-round dialog history. However, previous VD methods often treat the entire dialog history as a simple text input, di…
dialog state trackingDialogue State TrackingEntity AlignmentVisual DialogICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report
The Visual-Dialog Based Emotion Explanation Generation Challenge focuses on generating emotion explanations through visual-dialog interactions in art discussions. Our approach combines state-of-the-art multi-modal models…
Explanation GenerationLanguage ModelingLanguage ModellingVisual Dialog