@misc{indiciae9d33243d16a8, title = {EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning}, author = {Shuoqin Zhang and Tongtong Cheng and Xiru Gao and Jinzhuo Peng and Bin Zheng and Jiahao Tu and Ke Wang and Jia Pan and Zhe Hu and Kai Liu}, year = {2026}, url = {https://arxiv.org/abs/2608.03872}, note = {Source identifier: 2608.03872} }