TY - RPRT TI - HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks AU - Tiangang Li AU - Xiangbo Tian PY - 2026 UR - https://arxiv.org/abs/2607.28301 ID - 2607.28301 ER -