TY - RPRT TI - Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching AU - Zeqiao Li AU - Yijing Wang AU - Haoyu Wang AU - Zheng Li AU - Zhiqiang Zuo PY - 2026 UR - https://arxiv.org/abs/2602.01606 ID - 2602.01606 ER -