@article{batchpolicylearninginaveragereward, title = {Batch Policy Learning in Average Reward Markov Decision Processes}, author = {Peng Liao and Zhengling Qi and Runzhe Wan and Predrag Klasnja and Susan Murphy}, year = {2020}, eprint = {2007.11771}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2007.11771v3}, }