@article{onpolicypolicygradientreinforcement, title = {On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling}, author = {Nicholas E. Corrado and Josiah P. Hanna}, year = {2023}, eprint = {2311.08290}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2311.08290v2}, }