TY - RPRT TI - Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models AU - Inoussa Mouiche AU - Abderaouf Bahi PY - 2026 UR - https://arxiv.org/abs/2605.02626 ID - 2605.02626 ER -