@misc{indiciaea618d57bdcb3, title = {LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts}, author = {Ken Ding}, year = {2026}, url = {https://arxiv.org/abs/2607.27787}, note = {Source identifier: 2607.27787} }