TY - RPRT TI - FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning AU - Zhenglin Wan AU - Jingxuan Wu AU - Xingrui Yu AU - Chubin Zhang AU - Mingcong Lei AU - Bo An AU - Ivor Tsang PY - 2026 UR - https://arxiv.org/abs/2510.09222 ID - 2510.09222 ER -