TY - RPRT TI - LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts AU - Ken Ding PY - 2026 UR - https://arxiv.org/abs/2607.27787 ID - 2607.27787 ER -