TY - RPRT TI - STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning AU - Yao Luan AU - Ni Mu AU - Yiqin Yang AU - Bo Xu AU - Qing-Shan Jia PY - 2025 UR - https://arxiv.org/abs/2509.23802 ID - 2509.23802 ER -