TY - RPRT TI - ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models AU - Xiaomin Li AU - Xupeng Chen AU - Jingxuan Fan AU - Eric Hanchen Jiang AU - Mingye Gao PY - 2025 UR - https://arxiv.org/abs/2503.20995 ID - 2503.20995 ER -