TY - RPRT TI - Modification-Considering Value Learning for Reward Hacking Mitigation in RL AU - Evgenii Opryshko AU - Umangi Jain AU - Igor Gilitschenski PY - 2026 UR - https://arxiv.org/abs/2606.28955 ID - 2606.28955 ER -