@misc{indiciae5be9e231fc67, title = {OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search}, author = {Junyu Lu and Shichao Weng and Zhiqiang Wang and Haojie Luo and Jingfan Zhang and Yuhua Zhou and Cheng Du and Yuzhuo Zhang and Xi Li and Jinwei Du and Tiancheng Feng and Chuan Xiao and Shuyuan Zheng}, year = {2026}, url = {https://arxiv.org/abs/2609.40035}, note = {Source identifier: 2609.40035} }