TY - RPRT TI - RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training AU - Tao Ren AU - Jinyang Jiang AU - Hui Yang AU - Wan Tian AU - Minhao Zou AU - Guanghao Li AU - Zishi Zhang AU - Qinghao Wang AU - Shentao Qin AU - Yanjun Zhao AU - Rui Tao AU - Hui Shao AU - Yijie Peng PY - 2025 UR - https://arxiv.org/abs/2510.00911 ID - 2510.00911 ER -