paper-with-me

Papers

Explainable post-training bias mitigation with distribution-based fairness metrics

2025-04-01 · Ryan Franks, Alexey Miroshnikov

We develop a novel optimization framework with distribution-based fairness constraints for efficiently producing demographically blind, explainable models across a wide range of fairness levels. This is accomplished through post-processing, avoiding the need for retraining. Our framework, which is based on stochastic gradient descent, can be applied to a wide range of model types, with a particular emphasis on the post-processing of gradient-boosted decision trees. Additionally, we design a broad class of interpretable global bias metrics compatible with our method by building on previous work. We empirically test our methodology on a variety of datasets and compare it to other methods.

📄 PDF Abstract BibTeX arXiv:2504.01223

Code (0)

등록된 구현이 없습니다.

Tasks

Explainable ModelsFairness

Similar Papers 제목 키워드 기반

Model-agnostic bias mitigation methods with regressor distribution control for Wasserstein-based fairness metrics

2021-11-19 · Alexey Miroshnikov, Konstandinos Kotsiopoulos, Ryan Franks, Arjun Ravi Kannan

This article is a companion paper to our earlier work Miroshnikov et al. (2021) on fairness interpretability, which introduces bias explanations. In the current work, we propose a bias mitigation methodology based upon t…

Bayesian OptimizationFairness

MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion

2025-07-03 · Xin Guan, PeiHsin Lin, Zekun Wu, Ze Wang 외 arxiv

Multiperspective Fusion (MPF) is a novel posttraining alignment framework for large language models (LLMs) developed in response to the growing need for easy bias mitigation. Built on top of the SAGED pipeline, an automa…

Prompt Engineering

Predictive Uncertainty-based Bias Mitigation in Ranking

2023-09-18 · Maria Heuss, Daniel Cohen, Masoud Mansoury, Maarten de Rijke 외

Societal biases that are contained in retrieved documents have received increased interest. Such biases, which are often prevalent in the training data and learned by the model, can cause societal harms, by misrepresenti…

Fairness

BiasMap: Leveraging Cross-Attentions to Discover and Mitigate Hidden Social Biases in Text-to-Image Generation

2025-09-16 · Rajatsubhra Chakraborty, Xujun Che, Depeng Xu, Cori Faklaris 외 arxiv

Bias discovery is critical for black-box generative models, especiall text-to-image (TTI) models. Existing works predominantly focus on output-level demographic distributions, which do not necessarily guarantee concept r…

Text-to-Image Generation

Explaining Knock-on Effects of Bias Mitigation

2023-12-01 · Svetoslav Nizhnichenkov, Rahul Nair, Elizabeth Daly, Brian Mac Namee

In machine learning systems, bias mitigation approaches aim to make outcomes fairer across privileged and unprivileged groups. Bias mitigation methods work in different ways and have known "waterfall" effects, e.g., miti…

Fairness