paper-with-me

Papers

Calibrating Model-Based Evaluation Metrics for Summarization

2026-04-19 · Hongye Liu, Dhanajit Brahma, Ricardo Henao arxiv

Recent advances in summary evaluation are based on model-based metrics to assess quality dimensions, such as completeness, conciseness, and faithfulness. However, these methods often require large language models, and predicted scores are frequently miscalibrated, limiting their reliability. Moreover, evaluating the average quality across different summaries for a single document typically requires access to multiple reference summaries. Here, we propose a general framework that generates individual and average proxy scores without relying on reference summaries, human annotations, or expensive model-based metrics. We also propose group isotonic regression binning (GIRB), a calibration method that adjusts the raw predictions to better align with ground-truth evaluation metrics. While we focus on continuous-value scenarios, such as summarization, the method is applicable to discrete-value tasks, such as question answering. Experiments on seven datasets demonstrate that our approach consistently outperforms existing baselines.

📄 PDF Abstract BibTeX arXiv:2604.17200

Code (0)

등록된 구현이 없습니다.

Tasks

Question Answering

Similar Papers 제목 키워드 기반

Calibrating Likelihoods towards Consistency in Summarization Models

2023-10-12 · Polina Zablotskaia, Misha Khalman, Rishabh Joshi, Livio Baldini Soares 외

Despite the recent advances in abstractive text summarization, current summarization models still suffer from generating factually inconsistent summaries, reducing their utility for real-world application. We argue that …

Abstractive Text SummarizationNatural Language InferenceText Summarization

Revisiting Automatic Question Summarization Evaluation in the Biomedical Domain

2023-03-18 · Hongyi Yuan, Yaoyun Zhang, Fei Huang, Songfang Huang

Automatic evaluation metrics have been facilitating the rapid development of automatic summarization methods by providing instant and fair assessments of the quality of summaries. Most metrics have been developed for the…

Text Generation

Re-evaluating Evaluation in Text Summarization

2020-10-14 · EMNLP 2020 11 · Manik Bhandari, Pranav Gour, Atabak Ashfaq, PengFei Liu 외

Automated evaluation metrics as a stand-in for manual evaluation are an essential part of the development of text-generation tasks such as text summarization. However, while the field has progressed, our standard metrics…

Text GenerationText Summarization

SummEval: Re-evaluating Summarization Evaluation

2020-07-24 · Alexander R. Fabbri, Wojciech Kryściński, Bryan McCann, Caiming Xiong 외

The scarcity of comprehensive up-to-date studies on evaluation metrics for text summarization and the lack of consensus regarding evaluation protocols continue to inhibit progress. We address the existing shortcomings of…

Text Summarization

Spurious Correlations in Reference-Free Evaluation of Text Generation

2022-04-21 · ACL 2022 5 · Esin Durmus, Faisal Ladhak, Tatsunori Hashimoto

Model-based, reference-free evaluation metrics have been proposed as a fast and cost-effective approach to evaluate Natural Language Generation (NLG) systems. Despite promising recent results, we find evidence that refer…

Abstractive Text SummarizationText GenerationText Summarization