TY - RPRT TI - Active Advantage-Aligned Online Reinforcement Learning with Offline Data AU - Xuefeng Liu AU - Hung T. C. Le AU - Siyu Chen AU - Rick Stevens AU - Zhuoran Yang AU - Matthew R. Walter AU - Yuxin Chen PY - 2026 UR - https://arxiv.org/abs/2502.07937 ID - 2502.07937 ER -