@article{howneuralrewardmodelslearnfeaturesforpol, title = {How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis}, author = {Rei Higuchi and Ryotaro Kawata and Akifumi Wachi and Shokichi Takakura and Kohei Miyaguchi and Taiji Suzuki}, year = {2026}, eprint = {2605.24749}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.24749}, }