paper
-with-
me
Papers
Browse State-of-the-Art
Datasets
Methods
AI Agents
Trends
Digest
🌙
Audio captioning
벤치마크
Audio captioning on
Clotho
11개 결과 ·
⬇ CSV
·
JSON
SPIDEr
0.207
0.2382
0.2695
0.3008
0.332
2020-07
2026-09
Ensemble — 0.207 (2020-07-01)
Ensemble — 0.318 (2021-07-06)
Ensemble-RL — 0.295 (2021-07-06)
Qwen-Audio — 0.288 (2023-11-14)
Audio Flamingo (Pengi trainset) — 0.312 (2024-02-02)
LOAE — 0.33 (2024-06-19)
SLAM-AAC — 0.332 (2024-10-12)
MQ-Cap — 0.319 (2024-10-14)
Ensemble — 0.207 (2020-07-01)
Ensemble — 0.318 (2021-07-06)
LOAE — 0.33 (2024-06-19)
SLAM-AAC — 0.332 (2024-10-12)
2020-07-01 — Ensemble: SPIDEr 0.207
2021-07-06 — Ensemble: SPIDEr 0.318
2024-06-19 — LOAE: SPIDEr 0.33
2024-10-12 — SLAM-AAC: SPIDEr 0.332
Rank
Model
SPIDEr
CIDEr
SPICE
BLEU-4
METEOR
ROUGE-L
FENSE
SPIDEr-FL
Extra Training Data
Paper
Code
Year
1
SLAM-AAC
0.332
0.515
0.148
–
0.197
–
0.540
0.330
✓
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
X-LANCE/SLAM-LLM
2024
2
LOAE
0.330
0.513
0.147
–
0.197
–
0.538
0.330
✓
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
frankenliu/LOAE
2024
3
MQ-Cap
0.319
0.496
0.143
18.1
0.192
–
–
–
Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning
2024
4
Ensemble
0.318
0.400
0.137
–
–
–
–
–
✓
THE DCASE 2021 CHALLENGE TASK 6 SYSTEM: AUTOMATED AUDIO CAPTIONING WITH WEAKLY SUPERVISED PRE-TRAING AND WORD SELECTION METHODS
2021
5
Audio Flamingo (Pengi trainset)
0.312
0.489
0.134
17.4
18.7
39.4
–
–
✓
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
NVIDIA/audio-flamingo
2024
6
Ensemble-RL
0.295
0.468
0.123
–
–
–
–
–
✓
THE SJTU SYSTEM FOR DCASE2021 CHALLENGE TASK 6: AUDIO CAPTIONING BASED ON ENCODER PRE-TRAINING AND REINFORCEMENT LEARNING
wsntxxn/AudioCaption
2021
7
Qwen-Audio
0.288
0.441
0.136
–
–
–
–
–
✓
Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models
alibaba-damo-academy/FunASR
·
qwenlm/qwen-audio
2023
8
Ensemble
0.207
0.319
0.094
–
–
–
–
–
The NTT DCASE2020 Challenge Task 6 system: Automated Audio Captioning with Keywords and Sentence Length Estimation
2020
9
VAST
–
0.519
–
19
19.3
40.8
–
–
✓
VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset
TXH-mercury/VALOR
·
txh-mercury/vast
2023
10
VALOR
–
0.423
–
16.2
17.4
38.2
–
–
✓
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
TXH-mercury/VALOR
2023
11
RNN-GRU-EncDec + VGGish + Word2Vec
–
0.18
–
–
–
–
–
–
Audio Captioning using Gated Recurrent Units
2020
1–11 / 11
페이지당
10
20
50
100