Pre-gen metrics: Predicting caption quality metrics without generating captions
Image caption generation systems are typically evaluated against reference outputs. We show that it is possible to predict output quality without generating the captions, based on the probability assigned by the neural model to the reference captions. Such pre-gen metrics are strongly correlated to standard evaluation metrics.
Code (1)
Tasks
Caption GenerationSimilar Papers 제목 키워드 기반
Can Audio Captions Be Evaluated with Image Caption Metrics?
Automated audio captioning aims at generating textual descriptions for an audio clip. To evaluate the quality of generated audio captions, previous works directly adopt image captioning metrics like SPICE and CIDEr, with…
AudioCapsAudio captioningImage CaptioningSentenceVIVECaption: A Split Approach to Caption Quality Improvement
Caption quality has emerged as a critical bottleneck in training high-quality text-to-image (T2I) and text-to-video (T2V) generative models. While visual language models (VLMs) are commonly deployed to generate captions …
Image CaptioningImage Captioning with Clause-Focused Metrics in a Multi-Modal Setting for Marketing
Automatically generating descriptive captions for images is a well-researched area in computer vision. However, existing evaluation approaches focus on measuring the similarity between two sentences disregarding fine-gra…
DescriptiveImage CaptioningMarketingMulti-Task LearningVCRScore: Image captioning metric based on V\&L Transformers, CLIP, and precision-recall
Image captioning has become an essential Vision & Language research task. It is about predicting the most accurate caption given a specific image or video. The research community has achieved impressive results by contin…
Image CaptioningLearning-based Composite Metrics for Improved Caption Evaluation
The evaluation of image caption quality is a challenging task, which requires the assessment of two main aspects in a caption: adequacy and fluency. These quality aspects can be judged using a combination of several ling…
Image CaptioningLanguage ModelingLanguage ModellingSemantic Textual Similarity+1