Papers Generative Visual Question Answering
“Generative Visual Question Answering” 태그가 달린 논문 9편 · 필터 해제
VGAT: A Cancer Survival Analysis Framework Transitioning from Generative Visual Question Answering to Genomic Reconstruction
Multimodal learning combining pathology images and genomic sequences enhances cancer survival analysis but faces clinical implementation barriers due to limited access to genomic sequencing in under-resourced regions. To…
Generative Visual Question AnsweringQuestion AnsweringSurvival AnalysisSurvival Prediction+3Towards Flexible Evaluation for Generative Visual Question Answering
Throughout rapid development of multimodal large language models, a crucial ingredient is a fair and accurate evaluation of their multimodal comprehension abilities. Although Visual Question Answering (VQA) could serve a…
DecoderGenerative Visual Question AnsweringQuestion AnsweringSemantic Textual Similarity+3WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
Whole slide imaging is routinely adopted for carcinoma diagnosis and prognosis. Abundant experience is required for pathologists to achieve accurate and reliable diagnostic results of whole slide images (WSI). The huge s…
DiagnosticGenerative Visual Question AnsweringPrognosisQuestion Answering+5Can Generative AI Support Patients' & Caregivers' Informational Needs? Towards Task-Centric Evaluation Of AI Systems
Generative AI systems such as ChatGPT and Claude are built upon language models that are typically evaluated for accuracy on curated benchmark datasets. Such evaluation paradigms measure predictive and reasoning capabili…
Computed Tomography (CT)DiagnosticGenerative Visual Question AnsweringPrognosis+2Generative Visual Question Answering
Multi-modal tasks involving vision and language in deep learning continue to rise in popularity and are leading to the development of newer models that can generalize beyond the extent of their training data. The current…
Generative Visual Question AnsweringQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)Multimodal Prompt Retrieval for Generative Visual Question Answering
Recent years have witnessed impressive results of pre-trained vision-language models on knowledge-intensive tasks such as visual question answering (VQA). Despite the recent advances in VQA, existing methods mainly adopt…
Domain AdaptationGenerative Visual Question AnsweringQuestion AnsweringRetrieval+2PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
Medical Visual Question Answering (MedVQA) presents a significant opportunity to enhance diagnostic accuracy and healthcare delivery by leveraging artificial intelligence to interpret and answer questions based on medica…
BenchmarkingDiagnosticGenerative Visual Question AnsweringLanguage Modelling+5BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
The cost of vision-and-language pre-training has become increasingly prohibitive due to end-to-end training of large-scale models. This paper proposes BLIP-2, a generic and efficient pre-training strategy that bootstraps…
Generative Visual Question AnsweringImage CaptioningImage RetrievalImage to text+13Flamingo: a Visual Language Model for Few-Shot Learning
Building models that can be rapidly adapted to novel tasks using only a handful of annotated examples is an open challenge for multimodal machine learning research. We introduce Flamingo, a family of Visual Language Mode…
Few-Shot LearningGenerative Visual Question AnsweringLanguage ModelingLanguage Modelling+12