TY - RPRT TI - What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation AU - Ziyue Wang AU - Aomufei Yuan AU - Yiran Yao AU - Linli Yao AU - Hongyao Zuo AU - Ziwen Gong AU - Yuanxin Liu AU - Shicheng Li AU - Yishuo Cai AU - Tong Yang AU - Xu Sun AU - Xiaohui Li AU - Haoli Bai PY - 2026 UR - https://arxiv.org/abs/2608.22948 ID - 2608.22948 ER -