TY - RPRT TI - Distribution Matching Distillation Meets Reinforcement Learning AU - Dengyang Jiang AU - Dongyang Liu AU - Zanyi Wang AU - Qilong Wu AU - Liuzhuozheng Li AU - Hengzhuang Li AU - Xin Jin AU - David Liu AU - Changsheng Lu AU - Zhen Li AU - Bo Zhang AU - Mengmeng Wang AU - Steven Hoi AU - Peng Gao AU - Harry Yang PY - 2026 UR - https://arxiv.org/abs/2511.13649 ID - 2511.13649 ER -