@article{epoexplicitpolicyoptimizationfor, title = {EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning}, author = {Xiaoqian Liu and Ke Wang and Yongbin Li and Yuchuan Wu and Wentao Ma and Aobo Kong and Fei Huang and Jianbin Jiao and Junge Zhang}, year = {2025}, eprint = {2502.12486}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2502.12486v3}, }