@misc{indiciae3017ac1ca33a, title = {Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning}, author = {Hu Wang and Congbo Ma and Ian Reid and Mohammad Yaqub}, year = {2026}, url = {https://arxiv.org/abs/2505.07527}, note = {Source identifier: 2505.07527} }