paper-with-me

Papers

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

2025-05-23 · Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

Ultrasound is a widely-used imaging modality critical to global healthcare, yet its interpretation remains challenging due to its varying image quality on operators, noises, and anatomical structures. Although large vision-language models (LVLMs) have demonstrated impressive multimodal capabilities across natural and medical domains, their performance on ultrasound remains largely unexplored. We introduce U2-BENCH, the first comprehensive benchmark to evaluate LVLMs on ultrasound understanding across classification, detection, regression, and text generation tasks. U2-BENCH aggregates 7,241 cases spanning 15 anatomical regions and defines 8 clinically inspired tasks, such as diagnosis, view recognition, lesion localization, clinical value estimation, and report generation, across 50 ultrasound application scenarios. We evaluate 20 state-of-the-art LVLMs, both open- and closed-source, general-purpose and medical-specific. Our results reveal strong performance on image-level classification, but persistent challenges in spatial reasoning and clinical language generation. U2-BENCH establishes a rigorous and unified testbed to assess and accelerate LVLM research in the uniquely multimodal domain of medical ultrasound imaging.

📄 PDF Abstract BibTeX arXiv:2505.17779

Code (0)

등록된 구현이 없습니다.

Tasks

BenchmarkingSpatial ReasoningText Generation

Similar Papers 제목 키워드 기반

FetalCLIP: A Visual-Language Foundation Model for Fetal Ultrasound Image Analysis

2025-02-20 · Fadillah Maani, Numan Saeed, Tausifa Saleem, Zaid Farooq 외

Foundation models are becoming increasingly effective in the medical domain, offering pre-trained models on large datasets that can be readily adapted for downstream tasks. Despite progress, fetal ultrasound images remai…

Age EstimationBenchmarking

Multimodal Carotid Risk Stratification with Large Vision-Language Models: Benchmarking, Fine-Tuning, and Clinical Insights

2025-10-03 · Daphne Tsolissou, Theofanis Ganitidis, Konstantinos Mitsis, Stergios CHristodoulidis 외 arxiv

Reliable risk assessment for carotid atheromatous disease remains a major clinical challenge, as it requires integrating diverse clinical and imaging information in a manner that is transparent and interpretable to clini…

Domain Adaptation

FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound

2025-12-25 · Hussain Alasmawi, Numan Saeed, Mohammad Yaqub arxiv

The growing demand for prenatal ultrasound imaging has intensified a global shortage of trained sonographers, creating barriers to essential fetal health monitoring. Deep learning has the potential to enhance sonographer…

Visual Question AnsweringMultimodal Deep LearningVisual Grounding

Benchmarking Ultrasound Foundation Models for Fetal Plane Classification

2026-05-27 · Leya Barrientos, Yuexi Du, Nicha C. Dvornek arxiv

Ultrasound is widely used in obstetric care due to its safety, accessibility, and real-time imaging. However, interpretation remains operator-dependent and susceptible to noise and artifacts. Deep learning models have sh…

Adapting Vision-Language Foundation Model for Next Generation Medical Ultrasound Image Analysis

2025-06-10 · Jingguo Qu, Xinyang Han, Tonghuan Xiao, Jia Ai 외

Medical ultrasonography is an essential imaging technique for examining superficial organs and tissues, including lymph nodes, breast, and thyroid. It employs high-frequency ultrasound waves to generate detailed images o…

Domain AdaptationLarge Language Model