paper-with-me

Audio captioning 벤치마크

Audio captioning on Clotho

11개 결과 · ⬇ CSV · JSON

SPIDEr

0.207 0.2382 0.2695 0.3008 0.332 2020-07 2026-09 Ensemble — 0.207 (2020-07-01) Ensemble — 0.318 (2021-07-06) Ensemble-RL — 0.295 (2021-07-06) Qwen-Audio — 0.288 (2023-11-14) Audio Flamingo (Pengi trainset) — 0.312 (2024-02-02) LOAE — 0.33 (2024-06-19) SLAM-AAC — 0.332 (2024-10-12) MQ-Cap — 0.319 (2024-10-14) Ensemble — 0.207 (2020-07-01) Ensemble — 0.318 (2021-07-06) LOAE — 0.33 (2024-06-19) SLAM-AAC — 0.332 (2024-10-12)
RankModel SPIDErCIDErSPICEBLEU-4METEORROUGE-LFENSESPIDEr-FL Extra Training Data PaperCodeYear
1 SLAM-AAC 0.3320.5150.1480.1970.5400.330 SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs X-LANCE/SLAM-LLM 2024
2 LOAE 0.3300.5130.1470.1970.5380.330 Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding frankenliu/LOAE 2024
3 MQ-Cap 0.3190.4960.14318.10.192 Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning 2024
4 Ensemble 0.3180.4000.137 THE DCASE 2021 CHALLENGE TASK 6 SYSTEM: AUTOMATED AUDIO CAPTIONING WITH WEAKLY SUPERVISED PRE-TRAING AND WORD SELECTION METHODS 2021
5 Audio Flamingo (Pengi trainset) 0.3120.4890.13417.418.739.4 Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities NVIDIA/audio-flamingo 2024
6 Ensemble-RL 0.2950.4680.123 THE SJTU SYSTEM FOR DCASE2021 CHALLENGE TASK 6: AUDIO CAPTIONING BASED ON ENCODER PRE-TRAINING AND REINFORCEMENT LEARNING wsntxxn/AudioCaption 2021
7 Qwen-Audio 0.2880.4410.136 Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models alibaba-damo-academy/FunASR · qwenlm/qwen-audio 2023
8 Ensemble 0.2070.3190.094 The NTT DCASE2020 Challenge Task 6 system: Automated Audio Captioning with Keywords and Sentence Length Estimation 2020
9 VAST 0.5191919.340.8 VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset TXH-mercury/VALOR · txh-mercury/vast 2023
10 VALOR 0.42316.217.438.2 VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset TXH-mercury/VALOR 2023
11 RNN-GRU-EncDec + VGGish + Word2Vec 0.18 Audio Captioning using Gated Recurrent Units 2020
1–11 / 11 페이지당 10 20 50 100