TY - RPRT TI - Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models AU - Manh Nguyen AU - Dung Nguyen AU - Dai Do AU - Svetha Venkatesh AU - Hung Le PY - 2025 UR - https://arxiv.org/abs/2511.09864 ID - 2511.09864 ER -