TY - RPRT TI - When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL AU - Youting Wang AU - Yuan Tang AU - Bowen Liu AU - Xuan Liu AU - Dingyan Shang PY - 2026 UR - https://arxiv.org/abs/2605.28918 ID - 2605.28918 ER -