TY - RPRT TI - Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis AU - Leitian Tao AU - Xuefeng Du AU - Sharon Li PY - 2025 UR - https://arxiv.org/abs/2509.26074 ID - 2509.26074 ER -