paper-with-me

Papers

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

2026-03-09 · Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer arxiv

Auscultation is a vital diagnostic tool, yet its utility is often limited by subjective interpretation. While general-purpose Audio-Language Models (ALMs) excel in general domains, they struggle with the nuances of physiological signals. We propose a framework that aligns multi-site auscultation recordings directly with a frozen Large Language Model (LLM) embedding space via gated cross-attention. By leveraging the LLM's latent world knowledge, our approach moves beyond isolated classification toward holistic, patient-level assessment. On the CaReSound benchmark, our model achieves a state-of-the-art 0.865 F1-macro and 0.952 BERTScore. We demonstrate that lightweight, domain-specific encoders rival large-scale ALMs and that multi-site aggregation provides spatial redundancy that mitigates temporal truncation. This alignment of medical acoustics with text foundations offers a scalable path for bridging signal processing and clinical assessment.

📄 PDF Abstract BibTeX arXiv:2603.13362

Code (0)

등록된 구현이 없습니다.

Tasks

Question Answering

Similar Papers 제목 키워드 기반

EHRNavigator: A Multi-Agent System for Patient-Level Clinical Question Answering over Heterogeneous Electronic Health Records

2026-01-15 · Lingfei Qian, Mauro Giuffre, Yan Wang, Huan He 외 arxiv

Clinical decision-making increasingly relies on timely and context-aware access to patient information within Electronic Health Records (EHRs), yet most existing natural language question-answering (QA) systems are evalu…

Question Answering

Rethinking Patient Education as Multi-turn Multi-modal Interaction

2026-04-16 · Zonghai Yao, Zhipeng Tang, Chengtao Lin, Xiong Luo 외 arxiv

Most medical multimodal benchmarks focus on static tasks such as image question answering, report generation, and plain-language rewriting. Patient education is more demanding: systems must identify relevant evidence acr…

Question AnsweringVisual Grounding

Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

2026-06-21 · Xiangyuan Xue, Yang Yu, Yan Gao, Junyan Wang 외 arxiv

Pulmonary embolism (PE) is a high risk cardiopulmonary condition whose management requires both timely diagnosis and reliable assessment of future clinical risk. Because PE care routinely combines computed tomography pul…

Question Answering

MIMOQA: Multimodal Input Multimodal Output Question Answering

2021-06-01 · NAACL 2021 4 · Hrituraj Singh, Anshul Nasery, Denil Mehta, Aishwarya Agarwal 외

Multimodal research has picked up significantly in the space of question answering with the task being extended to visual question answering, charts question answering as well as multimodal input question answering. Howe…

Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)

RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

2026-02-04 · Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia 외 arxiv

As conversational multimodal AI tools are increasingly adopted to process patient data for health assessment, robust benchmarks are needed to measure progress and expose failure modes under realistic conditions. Despite …

Question Answering