@article{policyiterationwithhumanfeedbackbringing, title = {Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning}, author = {Minh-Ha Nguyen and Cathy Shyr}, year = {2026}, eprint = {2608.16831}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2608.16831}, }