@article{selftrainingwithdirectpreference, title = {Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning}, author = {Tianduo Wang and Shichen Li and Wei Lu}, year = {2024}, eprint = {2407.18248}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.18248v1}, }