TY - RPRT TI - Hard Negative Sample-Augmented DPO Post-Training for Small Language Models AU - Haocheng Lu AU - Minjun Zhu AU - Henry Yu PY - 2026 UR - https://arxiv.org/abs/2512.19728 ID - 2512.19728 ER -