@misc{indiciae8ede84a5bfcc, title = {On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling}, author = {Nicholas E. Corrado and Josiah P. Hanna}, year = {2026}, url = {https://arxiv.org/abs/2311.08290}, note = {Source identifier: 2311.08290} }