@article{demystifyingdesignchoicesofreinforcement, title = {Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective}, author = {Hong Xie and Xiao Hu and Tao Tan and Haoran Gu and Xin Li and Jianyu Han and Defu Lian and Enhong Chen}, year = {2026}, eprint = {2601.22532}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.22532}, }