TY - RPRT TI - Learning a Diffusion Model Policy from Rewards via Q-Score Matching AU - Michael Psenka AU - Alejandro Escontrela AU - Pieter Abbeel AU - Yi Ma PY - 2025 UR - https://arxiv.org/abs/2312.11752 ID - 2312.11752 ER -