paper-with-me

Papers Generative Visual Question Answering

“Generative Visual Question Answering” 태그가 달린 논문 9편 · 필터 해제

VGAT: A Cancer Survival Analysis Framework Transitioning from Generative Visual Question Answering to Genomic Reconstruction

2025-03-25 · Zizhi Chen, Minghao Han, Xukun Zhang, Shuwei Ma 외

Multimodal learning combining pathology images and genomic sequences enhances cancer survival analysis but faces clinical implementation barriers due to limited access to genomic sequencing in under-resourced regions. To…

Generative Visual Question AnsweringQuestion AnsweringSurvival AnalysisSurvival Prediction+3

Towards Flexible Evaluation for Generative Visual Question Answering

2024-08-01 · Huishan Ji, Qingyi Si, Zheng Lin, Weiping Wang

Throughout rapid development of multimodal large language models, a crucial ingredient is a fair and accurate evaluation of their multimodal comprehension abilities. Although Visual Question Answering (VQA) could serve a…

DecoderGenerative Visual Question AnsweringQuestion AnsweringSemantic Textual Similarity+3

WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering

2024-07-08 · Pingyi Chen, Chenglu Zhu, Sunyi Zheng, Honglin Li 외

Whole slide imaging is routinely adopted for carcinoma diagnosis and prognosis. Abundant experience is required for pathologists to achieve accurate and reliable diagnostic results of whole slide images (WSI). The huge s…

DiagnosticGenerative Visual Question AnsweringPrognosisQuestion Answering+5

Can Generative AI Support Patients' & Caregivers' Informational Needs? Towards Task-Centric Evaluation Of AI Systems

2024-01-31 · Shreya Rajagopal, Jae Ho Sohn, Hari Subramonyam, Shiwali Mohan

Generative AI systems such as ChatGPT and Claude are built upon language models that are typically evaluated for accuracy on curated benchmark datasets. Such evaluation paradigms measure predictive and reasoning capabili…

Computed Tomography (CT)DiagnosticGenerative Visual Question AnsweringPrognosis+2

Generative Visual Question Answering

2023-07-18 · Ethan Shen, Scotty Singh, Bhavesh Kumar

Multi-modal tasks involving vision and language in deep learning continue to rise in popularity and are leading to the development of newer models that can generalize beyond the extent of their training data. The current…

Generative Visual Question AnsweringQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)

Multimodal Prompt Retrieval for Generative Visual Question Answering

2023-06-30 · Timothy Ossowski, Junjie Hu

Recent years have witnessed impressive results of pre-trained vision-language models on knowledge-intensive tasks such as visual question answering (VQA). Despite the recent advances in VQA, existing methods mainly adopt…

Domain AdaptationGenerative Visual Question AnsweringQuestion AnsweringRetrieval+2

PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering

2023-05-17 · Xiaoman Zhang, Chaoyi Wu, Ziheng Zhao, Weixiong Lin 외

Medical Visual Question Answering (MedVQA) presents a significant opportunity to enhance diagnostic accuracy and healthcare delivery by leveraging artificial intelligence to interpret and answer questions based on medica…

BenchmarkingDiagnosticGenerative Visual Question AnsweringLanguage Modelling+5

BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

2023-01-30 · Conference 2023 2 · Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi

The cost of vision-and-language pre-training has become increasingly prohibitive due to end-to-end training of large-scale models. This paper proposes BLIP-2, a generic and efficient pre-training strategy that bootstraps…

Generative Visual Question AnsweringImage CaptioningImage RetrievalImage to text+13

Flamingo: a Visual Language Model for Few-Shot Learning

2022-04-29 · DeepMind 2022 4 · Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech 외

Building models that can be rapidly adapted to novel tasks using only a handful of annotated examples is an open challenge for multimodal machine learning research. We introduce Flamingo, a family of Visual Language Mode…

Few-Shot LearningGenerative Visual Question AnsweringLanguage ModelingLanguage Modelling+12
1–9 / 9