@article{alarmalignlanguagemodelsviahierarchical, title = {ALaRM: Align Language Models via Hierarchical Rewards Modeling}, author = {Yuhang Lai and Siyuan Wang and Shujun Liu and Xuanjing Huang and Zhongyu Wei}, year = {2024}, eprint = {2403.06754}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2403.06754v2}, }