TY - RPRT TI - Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs AU - Xingwei Gan AU - Ying Zhu PY - 2026 UR - https://arxiv.org/abs/2605.20555 ID - 2605.20555 ER -