TY - RPRT TI - Beyond Human Preferences: Exploring Reinforcement Learning Trajectory Evaluation and Improvement through LLMs AU - Zichao Shen AU - Tianchen Zhu AU - Qingyun Sun AU - Shiqi Gao AU - Jianxin Li PY - 2024 UR - https://arxiv.org/abs/2406.19644 ID - 2406.19644 ER -