@article{srmirshadowrewardmodelsbasedon, title = {HAIR: Hardness-Aware Inverse Reinforcement Learning with Introspective Reasoning for LLM Alignment}, author = {Ruoxi Cheng and Haoxuan Ma and Weixin Wang}, year = {2025}, eprint = {2503.18991}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.18991v2}, }