@inproceedings{offpolicyevaluationandlearningfrom, title = {Off-Policy Evaluation and Learning from Logged Bandit Feedback: Error Reduction via Surrogate Policy}, author = {Yuan Xie and Boyi Liu and Qiang Liu and Zhaoran Wang and Yuan Zhou and Jian Peng}, year = {2018}, booktitle = {ICLR 2019 5}, eprint = {1808.00232}, archivePrefix = {arXiv}, url = {http://arxiv.org/abs/1808.00232v1}, }