@inproceedings{directpolicygradientsdirectoptimization, title = {Direct Policy Gradients: Direct Optimization of Policies in Discrete Action Spaces}, author = {Guy Lorberbom and Chris J. Maddison and Nicolas Heess and Tamir Hazan and Daniel Tarlow}, year = {2019}, booktitle = {NeurIPS 2020 12}, eprint = {1906.06062}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/1906.06062v2}, }