TY - RPRT TI - SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models AU - Sihan Hu AU - Lyuhan Huang AU - Youjin Deng AU - Kun Chen PY - 2026 UR - https://arxiv.org/abs/2608.04975 ID - 2608.04975 ER -