TY - RPRT TI - Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning AU - Changwei Yao AU - Xinzi Liu AU - Chen Li AU - Marios Savvides PY - 2026 UR - https://arxiv.org/abs/2509.16136 ID - 2509.16136 ER -