@article{octothinkermidtrainingincentivizes, title = {OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling}, author = {Zengzhi Wang and Fan Zhou and Xuefeng Li and PengFei Liu}, year = {2025}, eprint = {2506.20512}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2506.20512v1}, }