TY - RPRT TI - Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning AU - Tianyuan Shi AU - Canbin Huang AU - Bei Li AU - Xin Chen AU - Xiaojun Quan AU - Jingang Wang AU - Qifan Wang PY - 2026 UR - https://arxiv.org/abs/2606.24064 ID - 2606.24064 ER -