TY - RPRT TI - Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs AU - Xiaozhe Li AU - Xinyu Fang AU - Shengyuan Ding AU - Yang Li AU - Linyang Li AU - Haodong Duan AU - Qingwen Liu AU - Kai Chen PY - 2026 UR - https://arxiv.org/abs/2605.08905 ID - 2605.08905 ER -