TY - RPRT TI - HERO: Human-Feedback Efficient Reinforcement Learning for Online Diffusion Model Finetuning AU - Ayano Hiranaka AU - Shang-Fu Chen AU - Chieh-Hsin Lai AU - Dongjun Kim AU - Naoki Murata AU - Takashi Shibuya AU - Wei-Hsiang Liao AU - Shao-Hua Sun AU - Yuki Mitsufuji PY - 2025 UR - https://arxiv.org/abs/2410.05116 ID - 2410.05116 ER -