@article{stepopsdstepawareonlinepreferencedistill, title = {StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning}, author = {Yanfei Zhang and Xu Lin and Chenglin Wu}, year = {2026}, eprint = {2605.27140}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.27140}, }