TY - RPRT TI - HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs AU - Ken Deng AU - Zizheng Zhan AU - Wen Xiang AU - Wenqiang Zhu AU - Weihao Li AU - Jingxuan Xu AU - Tianhao Peng AU - Xinping Lei AU - Kun Wu AU - Yifan Yao AU - Haoyang Huang AU - Huaixi Tang AU - Kepeng Lei AU - Zhiyi Lai AU - Songwei Yu AU - Zongxian Feng AU - Zuchen Gao AU - Weihao Xie AU - Chenchen Zhang AU - Yanan Wu AU - Yuanxing Zhang AU - Lecheng Huang AU - Yuqun Zhang AU - Jie Liu AU - Zhaoxiang Zhang AU - Haotian Zhang AU - Bin Chen AU - Jiaheng Liu PY - 2025 UR - https://arxiv.org/abs/2509.23967 ID - 2509.23967 ER -