paper-with-me

홈 › Papers

Guiding LLM Decision-Making with Fairness Reward Models

2025-07-15 · Zara Hall, Melanie Subbiah, Thomas P Zollo, Kathleen McKeown, Richard Zemel

Large language models are increasingly used to support high-stakes decisions, potentially influencing who is granted bail or receives a loan. Naive chain-of-thought sampling can improve average decision accuracy, but has also been shown to amplify unfair bias. To address this challenge and enable the trustworthy use of reasoning models in high-stakes decision-making, we propose a framework for training a generalizable Fairness Reward Model (FRM). Our model assigns a fairness score to LLM reasoning, enabling the system to down-weight biased trajectories and favor equitable ones when aggregating decisions across reasoning chains. We show that a single Fairness Reward Model, trained on weakly supervised, LLM-annotated examples of biased versus unbiased reasoning, transfers across tasks, domains, and model families without additional fine-tuning. Applied to real-world decision-making tasks including recidivism prediction and social media moderation, we show that our approach consistently improves fairness while matching, or even surpassing, baseline accuracy.

📄 PDF Abstract BibTeX arXiv:2507.11344

Code (1)

zarahall/fairness-prms 공식 구현

Tasks

Decision MakingFairness

Similar Papers 제목 키워드 기반

Long-Term Resource Allocation Fairness in Average Markov Decision Process (AMDP) Environment

2021-02-14 · Ganesh Ghalme, Vineet Nair, Vishakha Patil, Yilun Zhou

Fairness has emerged as an important concern in automated decision-making in recent years, especially when these decisions affect human welfare. In this work, we study fairness in temporally extended decision-making sett…

Decision MakingFairness

Fairness in Reinforcement Learning with Bisimulation Metrics

2024-12-22 · Sahand Rezaei-Shoshtari, Hanna Yurchyk, Scott Fujimoto, Doina Precup 외

Ensuring long-term fairness is crucial when developing automated decision making systems, specifically in dynamic and sequential environments. By maximizing their reward without consideration of fairness, AI agents can i…

Decision MakingFairnessreinforcement-learningReinforcement Learning+1

Online Restless Multi-Armed Bandits with Long-Term Fairness Constraints

2023-12-16 · Shufan Wang, Guojun Xiong, Jian Li

Restless multi-armed bandits (RMAB) have been widely used to model sequential decision making problems with constraints. The decision maker (DM) aims to maximize the expected total reward over an infinite horizon under a…

Decision MakingFairnessMulti-Armed BanditsReinforcement Learning (RL)+1

Policy Optimization with Advantage Regularization for Long-Term Fairness in Decision Systems

2022-10-22 · Eric Yang Yu, Zhizhen Qin, Min Kyung Lee, Sicun Gao

Long-term fairness is an important factor of consideration in designing and deploying learning-based decision systems in high-stake decision-making contexts. Recent work has proposed the use of Markov Decision Processes …

Decision MakingDeep Reinforcement LearningFairness

Fairness Aware Reinforcement Learning via Proximal Policy Optimization

2025-02-06 · Gabriele La Malfa, Jie M. Zhang, Michael Luck, Elizabeth Black

Fairness in multi-agent systems (MAS) focuses on equitable reward distribution among agents in scenarios involving sensitive attributes such as race, gender, or socioeconomic status. This paper introduces fairness in Pro…

AttributecounterfactualDecision MakingFairness+2