paper-with-me

홈 › Papers

Classification-Head Bias in Class-Level Machine Unlearning: Diagnosis, Mitigation, and Evaluation

2026-05-09 · Weidong Zheng, Kongyang Chen, Yuanwei Guo, Yatie Xiao arxiv

Class-level machine unlearning aims to remove the influence of specified classes while preserving model utility on retained classes. Existing methods are commonly evaluated by retain-set accuracy, forget-set accuracy, and unlearning time, but these metrics provide limited insight into how forgetting is achieved internally. In this paper, we reveal a bias-dominated shortcut in class-level unlearning: the prediction of forgotten classes can be suppressed by decreasing the corresponding bias terms in the final classification head. We first analyze the gradient dynamics of classification-head biases under softmax cross-entropy training, explaining why retain-set-only optimization tends to reduce the biases of absent classes. Based on this observation, we introduce BiasShift as a diagnostic baseline, showing that simple bias manipulation can satisfy conventional unlearning metrics while leaving abnormal bias patterns that reveal forgotten labels. To mitigate excessive forgotten-class bias suppression, we propose two bias-aware mechanisms, namely Two-Stage Bias Gradient Reversal Mechanism (TS-BGRM) and Lower-Bound Hinge Regularization (LB-HR). We further introduce three bias-oriented metrics, including Bias Stability Coefficient (BSC), Median Bias Gap (MBG), and Minimal Bias Score (MBS), to quantify bias dependence and potential leakage. Experiments on CIFAR-10, CIFAR-100, and Tiny-ImageNet demonstrate that the proposed methods maintain competitive unlearning performance while producing more stable bias distributions. We have released our code at {https://github.com/zwd2024/Beyond-the-Shadow-of-Bias-From-Classification-Head-Bias-to-Parameter-Redistribution}.

📄 PDF Abstract BibTeX arXiv:2605.08730

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

Fairness via Representation Neutralization

2021-06-23 · NeurIPS 2021 12 · Mengnan Du, Subhabrata Mukherjee, Guanchu Wang, Ruixiang Tang 외

Existing bias mitigation methods for DNN models primarily work on learning debiased encoders. This process not only requires a lot of instance-level annotations for sensitive attributes, it also does not guarantee that a…

AttributeClassificationFairness

HierBias: Context-Conditioned Hierarchical Media Bias Detection with Multi-Task Type Classification

2026-04-29 · Kaining Li, Ruichen Yan, Yuxin Dong arxiv

Media bias detection is a critical task for ensuring fair and balanced information dissemination, yet existing sentence-level approaches classify each sentence independently, ignoring inter-sentence contextual signals th…

Bias Detection

Head Motion Degrades Machine Learning Classification of Alzheimer's Disease from Positron Emission Tomography

2025-01-14 · Eléonore V. Lieffrig, Takuya Toyonaga, Jiazhen Zhang, John A. Onofrey

Brain positron emission tomography (PET) imaging is broadly used in research and clinical routines to study, diagnose, and stage Alzheimer's disease (AD). However, its potential cannot be fully exploited yet due to the l…

Binary ClassificationClassificationDiagnostic

Learning Muti-expert Distribution Calibration for Long-tailed Video Classification

2022-05-22 · Yufan Hu, Junyu Gao, Changsheng Xu

Most existing state-of-the-art video classification methods assume that the training data obey a uniform distribution. However, video data in the real world typically exhibit an imbalanced long-tailed class distribution,…

Classificationimage-classificationImage ClassificationVideo Classification

Exploring the Stability Gap in Continual Learning: The Role of the Classification Head

2024-11-06 · Wojciech Łapacz, Daniel Marczak, Filip Szatkowski, Tomasz Trzciński

Continual learning (CL) has emerged as a critical area in machine learning, enabling neural networks to learn from evolving data distributions while mitigating catastrophic forgetting. However, recent research has identi…

AttributeContinual LearningRepresentation Learning