TY - RPRT TI - Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles AU - Rattana Pukdee AU - Maria-Florina Balcan AU - Pradeep Ravikumar PY - 2026 UR - https://arxiv.org/abs/2605.30619 ID - 2605.30619 ER -