TY - RPRT TI - S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models AU - Nitish Shukla AU - Surgan Jandial AU - Arun Ross PY - 2026 UR - https://arxiv.org/abs/2604.18512 ID - 2604.18512 ER -