@misc{indiciae8961bcd6cecd, title = {Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying}, author = {Soichiro Nishimori and Paavo Parmas and Sotetsu Koyamada and Tadashi Kozuno and Toshinori Kitamura and Shin Ishii and Yutaka Matsuo}, year = {2026}, url = {https://arxiv.org/abs/2606.00151}, note = {Source identifier: 2606.00151} }