TY - RPRT TI - From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery AU - Lingzhe Zhang AU - Tong Jia AU - Yunpeng Zhai AU - Zixuan Xie AU - Chiming Duan AU - Minghua He AU - Philip S. Yu AU - Ying Li PY - 2026 UR - https://arxiv.org/abs/2605.15412 ID - 2605.15412 ER -