@inproceedings{variationalpolicygradientmethodfor, title = {Variational Policy Gradient Method for Reinforcement Learning with General Utilities}, author = {Junyu Zhang and Alec Koppel and Amrit Singh Bedi and Csaba Szepesvari and Mengdi Wang}, year = {2020}, booktitle = {NeurIPS 2020 12}, eprint = {2007.02151}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2007.02151v1}, }