paper-with-me

홈 › Papers

Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration

2025-05-11 · Honglong Yang, Shanshan Song, Yi Qin, Lehan Wang, Haonan Wang, Xinpeng Ding, Qixiang Zhang, Bodong Du, Xiaomeng Li

Generalist Medical AI (GMAI) systems have demonstrated expert-level performance in biomedical perception tasks, yet their clinical utility remains limited by inadequate multi-modal explainability and suboptimal prognostic capabilities. Here, we present XMedGPT, a clinician-centric, multi-modal AI assistant that integrates textual and visual interpretability to support transparent and trustworthy medical decision-making. XMedGPT not only produces accurate diagnostic and descriptive outputs, but also grounds referenced anatomical sites within medical images, bridging critical gaps in interpretability and enhancing clinician usability. To support real-world deployment, we introduce a reliability indexing mechanism that quantifies uncertainty through consistency-based assessment via interactive question-answering. We validate XMedGPT across four pillars: multi-modal interpretability, uncertainty quantification, and prognostic modeling, and rigorous benchmarking. The model achieves an IoU of 0.703 across 141 anatomical regions, and a Kendall's tau-b of 0.479, demonstrating strong alignment between visual rationales and clinical outcomes. For uncertainty estimation, it attains an AUC of 0.862 on visual question answering and 0.764 on radiology report generation. In survival and recurrence prediction for lung and glioma cancers, it surpasses prior leading models by 26.9%, and outperforms GPT-4o by 25.0%. Rigorous benchmarking across 347 datasets covers 40 imaging modalities and external validation spans 4 anatomical systems confirming exceptional generalizability, with performance gains surpassing existing GMAI by 20.7% for in-domain evaluation and 16.7% on 11,530 in-house data evaluation. Together, XMedGPT represents a significant leap forward in clinician-centric AI integration, offering trustworthy and scalable support for diverse healthcare applications.

📄 PDF Abstract BibTeX arXiv:2505.06898

Code (0)

등록된 구현이 없습니다.

Tasks

BenchmarkingDescriptiveDiagnosticQuestion AnsweringUncertainty QuantificationVisual Question Answering

Similar Papers 제목 키워드 기반

EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion

2025-05-23 · Zichuan Yang

Medical image classification is critical for clinical decision-making, yet demands for accuracy, interpretability, and generalizability remain challenging. This paper introduces EVM-Fusion, an Explainable Vision Mamba ar…

Decision Makingimage-classificationImage ClassificationMamba+1

ConceptCLIP: Towards Trustworthy Medical AI via Concept-Enhanced Contrastive Langauge-Image Pre-training

2025-01-26 · Yuxiang Nie, Sunan He, Yequan Bie, Yihui Wang 외

Trustworthiness is essential for the precise and interpretable application of artificial intelligence (AI) in medical imaging. Traditionally, precision and interpretability have been addressed as separate tasks, namely m…

ArticlesConcept AlignmentMedical Image Analysis

GigaPevt: Multimodal Medical Assistant

2024-02-26 · Pavel Blinov, Konstantin Egorov, Ivan Sviridov, Nikolay Ivanov 외

Building an intelligent and efficient medical assistant is still a challenging AI problem. The major limitation comes from the data modality scarceness, which reduces comprehensive patient perception. This demo paper pre…

Question Answering

A Fully Transformer Based Multimodal Framework for Explainable Cancer Image Segmentation Using Radiology Reports

2025-08-19 · Enobong Adahada, Isabel Sassoon, Kate Hone, Yongmin Li arxiv

We introduce Med-CTX, a fully transformer based multimodal framework for explainable breast cancer ultrasound segmentation. We integrate clinical radiology reports to boost both performance and interpretability. Med-CTX …

Image Segmentation

MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants

2024-12-17 · Hritik Bansal, Daniel Israel, Siyan Zhao, Shufan Li 외

Recent advancements in mixed-modal generative models have enabled flexible integration of information across image-text content. These models have opened new avenues for developing unified biomedical assistants capable o…

Image CaptioningQuestion AnsweringVisual Question Answering