TY - RPRT TI - Learning Goal-Conditioned Representations for Language Reward Models AU - Vaskar Nath AU - Dylan Slack AU - Jeff Da AU - Yuntao Ma AU - Hugh Zhang AU - Spencer Whitehead AU - Sean Hendryx PY - 2024 UR - https://arxiv.org/abs/2407.13887 ID - 2407.13887 ER -