TY - RPRT TI - Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective AU - Xiao Hu AU - Hong Xie AU - Tao Tan AU - Defu Lian AU - Jianyu Han PY - 2026 UR - https://arxiv.org/abs/2601.14599 ID - 2601.14599 ER -