TY - RPRT TI - Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning AU - Shentong Mo PY - 2026 UR - https://arxiv.org/abs/2604.13504 ID - 2604.13504 ER -