TY - RPRT TI - Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement AU - Guanwen Xie AU - Jingzehua Xu AU - Yiyuan Yang AU - Yimian Ding AU - Shuai Zhang PY - 2026 UR - https://arxiv.org/abs/2409.02428 ID - 2409.02428 ER -