TY - RPRT TI - Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning AU - Yuhui Chen AU - Haoran Li AU - Zhennan Jiang AU - Yuxing Qin AU - Yuxuan Wan AU - Weiheng Liu AU - Dongbin Zhao PY - 2026 UR - https://arxiv.org/abs/2604.01860 ID - 2604.01860 ER -