TY - RPRT TI - Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models AU - Shuo Nie AU - Hexuan Deng AU - Chao Wang AU - Ruiyu Fang AU - Xuebo Liu AU - Shuangyong Song AU - Yu Li AU - Min Zhang AU - Xuelong Li PY - 2026 UR - https://arxiv.org/abs/2602.05897 ID - 2602.05897 ER -