@article{advantageawarepolicyoptimizationfor, title = {A2PO: Towards Effective Offline Reinforcement Learning from an Advantage-aware Perspective}, author = {Yunpeng Qing and Shunyu Liu and Jingyuan Cong and KaiXuan Chen and Yihe Zhou and Mingli Song}, year = {2024}, eprint = {2403.07262}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2403.07262v4}, }