@article{zerothorderpolicygradientfor, title = {Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference}, author = {Qining Zhang and Lei Ying}, year = {2024}, eprint = {2409.17401}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2409.17401v1}, }