TY - RPRT TI - Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control AU - Yuxuan Gao AU - Yedong Shen AU - Shiqi Zhang AU - Wenhao Yu AU - Yifan Duan AU - Jia pan AU - Jiajia Wu AU - Jiajun Deng AU - Yanyong Zhang PY - 2026 UR - https://arxiv.org/abs/2604.03540 ID - 2604.03540 ER -