paper-with-me

홈 › Papers

Uncertainty-based Debiasing and Unlearning for Decontamination

2026-06-22 · Guangzhi Sun, Xiao Zhan, Mark Gales arxiv

Benchmark-based evaluation is the dominant paradigm for assessing large language model (LLM) capabilities, yet data contamination inflates reported performance and undermines fair comparison. Existing decontamination methods are evaluated solely through aggregate accuracy, which can obscure substantial differences in per-sample model behaviour, and many require access to an uncontaminated model. In this paper, we propose a sample-level evaluation framework for decontamination that complements accuracy-based assessment with distributional distance metrics, measuring how closely a decontaminated model recovers the output distribution of an uncontaminated model on each sample. Building on this framework, we introduce Uncertainty-Based Decontamination (UBD), a family of methods that leverage deep ensembles of the contaminated model to estimate per-sample memorization without requiring a uncontaminated model or knowledge of which samples are contaminated. UBD estimates a per-sample correction scalar from ensemble uncertainty, which is used to construct a debiased target distribution that suppresses the inflated probability mass on correct answers induced by contamination. This target is then used either as a post-hoc output correction (debiasing) or as a soft training signal for parameter update (unlearning). Experiments on MMLU-Pro and MATH-MCQA across multiple LLM backbones demonstrate that UBD produces per-sample output distributions substantially closer to those of an uncontaminated model than paraphrasing or choice-permutation baselines, while preserving model performance on uncontaminated data.

📄 PDF Abstract BibTeX arXiv:2606.23313

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

Towards Transfer Unlearning: Empirical Evidence of Cross-Domain Bias Mitigation

2024-07-24 · Huimin Lu, Masaru Isonuma, Junichiro Mori, Ichiro Sakata

Large language models (LLMs) often inherit biases from vast amounts of training corpora. Traditional debiasing methods, while effective to some extent, do not completely eliminate memorized biases and toxicity in LLMs. I…

Language ModelingLanguage Modelling

Erasing CLIP Memories: Non-Destructive, Data-Free Zero-Shot class Unlearning in CLIP Models

2025-12-16 · Ashish Mishra, Tarun Kumar, Gyanaranjan Nayak, Arpit Shah 외 arxiv

We introduce a novel, closed-form approach for selective unlearning in multimodal models, specifically targeting pretrained models such as CLIP. Our method leverages nullspace projection to erase the target class informa…

Mitigating Biases in Language Models via Bias Unlearning

2025-09-30 · Dianqing Liu, Yi Liu, Guoqing Jin, Zhendong Mao arxiv

Many studies have shown various biases targeting different demographic groups in language models, amplifying discrimination and harming fairness. Recent parameter modification debiasing approaches significantly degrade c…

Enabling Group Fairness in Graph Unlearning via Bi-level Debiasing

2025-05-14 · Yezi Liu, Prathyush Poduval, Wenjun Huang, Yang Ni 외

Graph unlearning is a crucial approach for protecting user privacy by erasing the influence of user data on trained graph models. Recent developments in graph unlearning methods have primarily focused on maintaining mode…

Fairness

Skin Deep Unlearning: Artefact and Instrument Debiasing in the Context of Melanoma Classification

2021-09-20 · Peter J. Bevan, Amir Atapour-Abarghouei

Convolutional Neural Networks have demonstrated dermatologist-level performance in the classification of melanoma from skin lesion images, but prediction irregularities due to biases seen within the training data are an …

Skin Cancer Classification