TY - RPRT TI - Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback AU - Yen-Ting Lin AU - Di Jin AU - Tengyu Xu AU - Tianhao Wu AU - Sainbayar Sukhbaatar AU - Chen Zhu AU - Yun He AU - Yun-Nung Chen AU - Jason Weston AU - Yuandong Tian AU - Arash Rahnama AU - Sinong Wang AU - Hao Ma AU - Han Fang PY - 2025 UR - https://arxiv.org/abs/2501.10799 ID - 2501.10799 ER -