TY - RPRT TI - Self-Play Enhancement via Advantage-Weighted Refinement in Online Federated LLM Fine-Tuning with Real-Time Feedback AU - Seohyun Lee AU - Wenzhi Fang AU - Dong-Jun Han AU - Seyyedali Hosseinalipour AU - Christopher G. Brinton PY - 2026 UR - https://arxiv.org/abs/2605.07977 ID - 2605.07977 ER -