paper-with-me

Papers

Multimodal Learning and Cognitive Processes in Radiology: MedGaze for Chest X-ray Scanpath Prediction

2024-06-28 · Akash Awasthi, Ngan Le, Zhigang Deng, Rishi Agrawal, Carol C. Wu, Hien Van Nguyen

Predicting human gaze behavior within computer vision is integral for developing interactive systems that can anticipate user attention, address fundamental questions in cognitive science, and hold implications for fields like human-computer interaction (HCI) and augmented/virtual reality (AR/VR) systems. Despite methodologies introduced for modeling human eye gaze behavior, applying these models to medical imaging for scanpath prediction remains unexplored. Our proposed system aims to predict eye gaze sequences from radiology reports and CXR images, potentially streamlining data collection and enhancing AI systems using larger datasets. However, predicting human scanpaths on medical images presents unique challenges due to the diverse nature of abnormal regions. Our model predicts fixation coordinates and durations critical for medical scanpath prediction, outperforming existing models in the computer vision community. Utilizing a two-stage training process and large publicly available datasets, our approach generates static heatmaps and eye gaze videos aligned with radiology reports, facilitating comprehensive analysis. We validate our approach by comparing its performance with state-of-the-art methods and assessing its generalizability among different radiologists, introducing novel strategies to model radiologists' search patterns during CXR image diagnosis. Based on the radiologist's evaluation, MedGaze can generate human-like gaze sequences with a high focus on relevant regions over the CXR images. It sometimes also outperforms humans in terms of redundancy and randomness in the scanpaths.

📄 PDF Abstract BibTeX arXiv:2407.00129

Code (0)

등록된 구현이 없습니다.

Tasks

Scanpath prediction

Methods 이 논문이 사용한 방법론

Focus 설명 없음

Similar Papers 제목 키워드 기반

Gla-AI4BioMed at RRG24: Visual Instruction-tuned Adaptation for Radiology Report Generation

2024-12-06 · Xi Zhang, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

We introduce a radiology-focused visual language model designed to generate radiology reports from chest X-rays. Building on previous findings that large language models (LLMs) can acquire multimodal capabilities when al…

Language ModelingLanguage Modelling

Utility of Multimodal Large Language Models in Analyzing Chest X-ray with Incomplete Contextual Information

2024-09-20 · Choonghan Kim, Seonhee Cho, Joo Heung Yoon

Background: Large language models (LLMs) are gaining use in clinical settings, but their performance can suffer with incomplete radiology reports. We tested whether multimodal LLMs (using text and images) could improve a…

Large Language Model

ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification

2025-04-29 · Ziqing Fan, Cheng Liang, Chaoyi Wu, Ya zhang 외

Recent advances in reasoning-enhanced large language models (LLMs) and multimodal LLMs (MLLMs) have significantly improved performance in complex tasks, yet medical AI models often overlook the structured reasoning proce…

DiagnosticQuestion AnsweringVisual Question Answering

Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models

2026-01-11 · Shaonan Liu, Guo Yu, Xiaoling Luo, Shiyi Zheng 외 arxiv

Medical Multimodal Large Language Models (Med-MLLMs) require egocentric clinical intent understanding for real-world deployment, yet existing benchmarks fail to evaluate this critical capability. To address these challen…

CT-Agent: A Multimodal-LLM Agent for 3D CT Radiology Question Answering

2025-05-22 · YUREN MAO, Wenyi Xu, Yuyang Qin, Yunjun Gao

Computed Tomography (CT) scan, which produces 3D volumetric medical data that can be viewed as hundreds of cross-sectional images (a.k.a. slices), provides detailed anatomical information for diagnosis. For radiologists,…

Computed Tomography (CT)Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)