TY - RPRT TI - Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective AU - Hong Xie AU - Xiao Hu AU - Tao Tan AU - Haoran Gu AU - Xin Li AU - Jianyu Han AU - Defu Lian AU - Enhong Chen PY - 2026 UR - https://arxiv.org/abs/2601.22532 ID - 2601.22532 ER -