TY - RPRT TI - Learning an Efficient Optimizer via Hybrid-Policy Sub-Trajectory Balance AU - Yunchuan Guan AU - Yu Liu AU - Ke Zhou AU - Hui Li AU - Sen Jia AU - Zhiqi Shen AU - Ziyang Wang AU - Xinglin Zhang AU - Tao Chen AU - Jenq-Neng Hwang AU - Lei Li PY - 2025 UR - https://arxiv.org/abs/2511.00543 ID - 2511.00543 ER -