TY - RPRT TI - Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs AU - Yiming Huang AU - Zhenbo Shi AU - Xin-Cheng Wen AU - Jichuan Zeng AU - Cuiyun Gao AU - Peiyi Han AU - Chuanyi Liu PY - 2026 UR - https://arxiv.org/abs/2605.04065 ID - 2605.04065 ER -