TY - RPRT TI - Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs AU - Jingyao Wang AU - Wenwen Qiang AU - Zeen Song AU - Changwen Zheng AU - Hui Xiong PY - 2025 UR - https://arxiv.org/abs/2505.10425 ID - 2505.10425 ER -