TY - RPRT TI - A First-Order Logic-Based Alternative to Reward Models in RLHF AU - Chunjin Jian AU - Xinhua Zhu PY - 2025 UR - https://arxiv.org/abs/2512.14100 ID - 2512.14100 ER -