TY - RPRT TI - Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs AU - Hao Sun AU - Yunyi Shen AU - Jean-Francois Ton AU - Mihaela van der Schaar PY - 2025 UR - https://arxiv.org/abs/2502.04357 ID - 2502.04357 ER -