@article{explainablereinforcementlearningfromhuma, title = {Explainable reinforcement learning from human feedback to improve alignment}, author = {Shicheng Liu and Siyuan Xu and Wenjie Qiu and Hangfan Zhang and Minghui Zhu}, year = {2025}, eprint = {2512.13837}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2512.13837}, }