TY - RPRT TI - EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning AU - Shuoqin Zhang AU - Tongtong Cheng AU - Xiru Gao AU - Jinzhuo Peng AU - Bin Zheng AU - Jiahao Tu AU - Ke Wang AU - Jia Pan AU - Zhe Hu AU - Kai Liu PY - 2026 UR - https://arxiv.org/abs/2608.03872 ID - 2608.03872 ER -