TY - RPRT TI - The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains AU - Scott Geng AU - Hamish Ivison AU - Chun-Liang Li AU - Maarten Sap AU - Jerry Li AU - Ranjay Krishna AU - Pang Wei Koh PY - 2025 UR - https://arxiv.org/abs/2507.06187 ID - 2507.06187 ER -