paper-with-me

Papers Visual Question Answering (VQA) Split A

“Visual Question Answering (VQA) Split A” 태그가 달린 논문 5편 · 필터 해제

NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization

2024-12-20 · Danial Kamali, Elham J. Barezi, Parisa Kordjamshidi

Compositional generalization is crucial for artificial intelligence agents to solve complex vision-language reasoning tasks. Neuro-symbolic approaches have demonstrated promise in capturing compositional structures, but …

Compositional Generalization (AVG)Novel ConceptsVisual Question AnsweringVisual Question Answering (VQA)+2

What's Left? Concept Grounding with Logic-Enhanced Foundation Models

2023-10-24 · Joy Hsu, Jiayuan Mao, Joshua B. Tenenbaum, Jiajun Wu

Recent works such as VisProg and ViperGPT have smartly composed foundation models for visual reasoning-using large language models (LLMs) to produce programs that can be executed by pre-trained vision-language models. Ho…

Visual Question Answering (VQA) Split AVisual Question Answering (VQA) Split BVisual Reasoning

MDETR - Modulated Detection for End-to-End Multi-Modal Understanding

2021-01-01 · ICCV 2021 10 · Aishwarya Kamath, Mannat Singh, Yann Lecun, Gabriel Synnaeve 외

Multi-modal reasoning systems rely on a pre-trained object detector to extract regions of interest from the image. However, this crucial module is typically used as a black box, trained independently of the downstrea…

Phrase GroundingQuestion AnsweringReferring ExpressionReferring Expression Comprehension+4

Transparency by Design: Closing the Gap Between Performance and Interpretability in Visual Reasoning

2018-03-14 · CVPR 2018 6 · David Mascharka, Philip Tran, Ryan Soklaski, Arjun Majumdar

Visual question answering requires high-order reasoning about an image, which is a fundamental capability needed by machine systems to follow complex directives. Recently, modular networks have been shown to be an effect…

Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)Visual Question Answering (VQA) Split A+2

FiLM: Visual Reasoning with a General Conditioning Layer

2017-09-22 · Ethan Perez, Florian Strub, Harm de Vries, Vincent Dumoulin 외

We introduce a general-purpose conditioning method for neural networks called FiLM: Feature-wise Linear Modulation. FiLM layers influence neural network computation via a simple, feature-wise affine transformation based …

Image Retrieval with Multi-Modal QueryVisual Question Answering (VQA)Visual Question Answering (VQA) Split AVisual Question Answering (VQA) Split B+1
1–5 / 5