TY - RPRT TI - An Empirical Study of Reward Specification and Benchmark Reliability in GRPO-based LLM Unlearning AU - Rubén Balbastre AU - Juan Manuel Orduña AU - Mariano Pérez PY - 2026 UR - https://arxiv.org/abs/2608.17804 ID - 2608.17804 ER -