TY - RPRT TI - Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients AU - Byung-Kwan Lee AU - Ximing Lu AU - Shizhe Diao AU - Minki Kang AU - Saurav Muralidharan AU - Karan Sapra AU - Andrew Tao AU - Yu-Chiang Frank Wang AU - Ryo Hachiuma PY - 2026 UR - https://arxiv.org/abs/2606.18216 ID - 2606.18216 ER -