@article{fromfeedbackloopstopolicyupdatesreinforc, title = {From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery}, author = {Lingzhe Zhang and Tong Jia and Yunpeng Zhai and Zixuan Xie and Chiming Duan and Minghua He and Philip S. Yu and Ying Li}, year = {2026}, eprint = {2605.15412}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.15412}, }