TY - RPRT TI - OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search AU - Junyu Lu AU - Shichao Weng AU - Zhiqiang Wang AU - Haojie Luo AU - Jingfan Zhang AU - Yuhua Zhou AU - Cheng Du AU - Yuzhuo Zhang AU - Xi Li AU - Jinwei Du AU - Tiancheng Feng AU - Chuan Xiao AU - Shuyuan Zheng PY - 2026 UR - https://arxiv.org/abs/2609.40035 ID - 2609.40035 ER -