TY - RPRT TI - Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning AU - Hu Wang AU - Congbo Ma AU - Ian Reid AU - Mohammad Yaqub PY - 2026 UR - https://arxiv.org/abs/2505.07527 ID - 2505.07527 ER -