paper-with-me

Papers Audio captioning

“Audio captioning” 태그가 달린 논문 140편 · 필터 해제

MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

2026-07-29 · Weijie Wu, Junbo Li, Lin Li, Jun Fang 외 arxiv

With the development of audio large language models (AudioLLMs), audio captioning needs to move from brief descriptions toward open-ended and fine-grained free-form descriptions. Existing evaluations often focus on gener…

Audio captioning

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

2026-07-23 · Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright, Magdalena Fuentes arxiv

Recent advancements in automated audio captioning (AAC) have shifted from monolithic sentence generation toward structured formats that explicitly disentangle distinct acoustic and semantic properties. However, evaluatin…

Logical ReasoningAudio captioning

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

2026-07-06 · Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis, Ravi Shekhar arxiv

Modern automated audio captioning systems pair a frozen audio encoder with a large language model (LLM) via a trainable projector, incurring the encoder's inference cost and bottlenecking the model through its fixed acou…

Audio captioning

MOSS-Audio Technical Report

2026-06-01 · Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu 외 arxiv

MOSS-Audio is a unified audio-language model for speech, environmental sound, and music understanding, supporting audio captioning, time-aware question answering, timestamped transcription, and audio-grounded reasoning. …

Instruction FollowingQuestion AnsweringAudio captioning

Locality Matters for Training-Free Audio Token Compression in Audio-Language Models

2026-05-24 · Jiale Luo, Xiaoyu Liang, Haoji Hu arxiv

Audio-language models (ALMs) are increasingly used for audio captioning, question answering, and open-ended audio understanding, but their inference cost remains high when audio inputs are represented as long prefix-toke…

Question AnsweringAudio captioning

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

2026-04-15 · Yanfeng Shi, Pengfei Cai, Jun Liu, Qing Gu 외 arxiv

Large Audio-Language Models (LALMs) enable general audio understanding and demonstrate remarkable performance across various audio tasks. However, these models still face challenges in temporal perception (e.g., inferrin…

Reinforcement LearningSound Event DetectionAudio captioning

CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation

2026-03-20 · Insung Lee, Taeyoung Jeong, Haejun Yoo, Du-Seong Chang 외 arxiv

While Large Audio-Language Models (LALMs) have advanced audio captioning, robust evaluation remains difficult. Reference-based metrics are expensive and often fail to assess acoustic fidelity, while Contrastive Language-…

Audio captioning

AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech

2026-02-27 · Jielin Qiu, Jianguo Zhang, Zixiang Chen, Liangwei Yang 외 arxiv

We introduce AudioCapBench, a benchmark for evaluating audio captioning capabilities of large multimodal models. \method covers three distinct audio domains, including environmental sound, music, and speech, with 1,000 c…

Audio captioning

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

2026-02-15 · Dan Zhang, Yishu Lei, Jing Hu, Shuwei He 외 arxiv

We present Eureka-Audio, a compact yet high-performance audio language model that achieves competitive performance against models that are 4 to 18 times larger across a broad range of audio understanding benchmarks. Desp…

Instruction FollowingSpeech RecognitionAudio captioning

SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

2026-01-14 · Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao 외 arxiv

The recent surge in open-source Multimodal Large Language Models (MLLM) frameworks, such as LLaVA, provides a convenient kickoff for artificial intelligence developers and researchers. However, most of the MLLM framework…

parameter-efficient fine-tuningSpeech RecognitionAudio captioning

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

2026-01-08 · Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung arxiv

Automated Audio Captioning aims to describe the semantic content of input audio. Recent works have employed large language models (LLMs) as a text decoder to leverage their reasoning capabilities. However, prior approach…

Audio captioning

Semantic-Aware Confidence Calibration for Automated Audio Captioning

2025-12-11 · Lucas Dunker, Sai Akshay Menta, Snigdha Mohana Addepalli, Venkata Krishna Rayalu Garapati arxiv

Automated audio captioning models frequently produce overconfident predictions regardless of semantic accuracy, limiting their reliability in deployment. This deficiency stems from two factors: evaluation metrics based o…

Semantic SimilarityAudio captioning

BRACE: A Benchmark for Robust Audio Caption Quality Evaluation

2025-12-11 · Tianyu Guo, Hongyu Chen, Hao Liang, Meiyi Qiang 외 arxiv

Automatic audio captioning is essential for audio understanding, enabling applications such as accessibility and content indexing. However, evaluating the quality of audio captions remains a major challenge, especially i…

Audio captioning

AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs

2025-11-17 · Zhe Sun, Yujun Cai, Jiayu Yao, Yiwei Wang arxiv

Large Audio-Language Models (LALMs) have recently shown impressive progress in speech recognition, audio captioning, and auditory question answering. Yet, whether these models can perceive spatial dynamics, particularly …

Speech RecognitionQuestion AnsweringSpatial ReasoningAudio captioning

Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?

2025-10-16 · Qixin Deng, Bryan Pardo, Thrasyvoulos N Pappas arxiv

Understanding and modeling the relationship between language and sound is critical for applications such as music information retrieval,text-guided music generation, and audio captioning. Central to these tasks is the us…

Information RetrievalAudio captioningMusic Generation

Adaptive vector steering: A training-free, layer-wise intervention for hallucination mitigation in large audio and multimodal models

2025-10-14 · Tsung-En Lin, Kuan-Yi Lee, Hung-Yi Lee arxiv

Large Audio-Language Models and Multi-Modal Large Language Models have demonstrated strong capabilities in tasks such as Audio Question Answering (AQA), Audio Captioning, and Automatic Speech Recognition (ASR). However, …

Speech RecognitionQuestion AnsweringAudio captioning

Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap

2025-10-13 · KiHyun Nam, Jongmin Choi, Hyeongkeun Lee, Jungwoo Heo 외 arxiv

Contrastive audio-language pretraining yields powerful joint representations, yet a persistent audio-text modality gap limits the benefits of coupling multimodal encoders with large language models (LLMs). We present Dif…

Audio captioning

AURA Score: A Metric For Holistic Audio Question Answering Evaluation

2025-10-06 · Satvik Dixit, Soham Deshmukh, Bhiksha Raj arxiv

Audio Question Answering (AQA) is a key task for evaluating Audio-Language Models (ALMs), yet assessing open-ended responses remains challenging. Existing metrics used for AQA such as BLEU, METEOR and BERTScore, mostly a…

Question AnsweringAudio captioning

Qwen3-Omni Technical Report

2025-09-22 · Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu 외 arxiv

We present Qwen3-Omni, a single multimodal model that, for the first time, maintains state-of-the-art performance across text, image, audio, and video without any degradation relative to single-modal counterparts. Qwen3-…

Multimodal ReasoningAudio captioning

Aligning Audio Captions with Human Preferences

2025-09-18 · Kartik Hegde, Rehana Mahfuz, Yinyi Guo, Erik Visser arxiv

Current audio captioning relies on supervised learning with paired audio-caption data, which is costly to curate and may not reflect human preferences in real-world scenarios. To address this, we propose a preference-ali…

Reinforcement LearningAudio captioning
1–20 / 140 다음 →