@article{greedificationoperatorsforpolicy, title = {Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences}, author = {Alan Chan and Hugo Silva and Sungsu Lim and Tadashi Kozuno and A. Rupam Mahmood and Martha White}, year = {2021}, eprint = {2107.08285}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2107.08285v2}, }