TY - RPRT TI - SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions AU - Ashima Suvarna AU - Kendrick Phan AU - Mehrab Beikzadeh AU - Hritik Bansal AU - Saadia Gabriel PY - 2026 UR - https://arxiv.org/abs/2604.08477 ID - 2604.08477 ER -