TY - RPRT TI - EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms AU - Guilin Zhang AU - Chuanyi Sun AU - Kai Zhao AU - Xu Chu AU - Shahryar Sarkani AU - John M. Fossaceca PY - 2026 UR - https://arxiv.org/abs/2606.04145 ID - 2606.04145 ER -