@article{offlinereinforcementlearningwithclosed, title = {Offline Reinforcement Learning with Closed-Form Policy Improvement Operators}, author = {Jiachen Li and Edwin Zhang and Ming Yin and Qinxun Bai and Yu-Xiang Wang and William Yang Wang}, year = {2022}, eprint = {2211.15956}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2211.15956v3}, }