TY - RPRT TI - Automating Expert-Level Medical Reasoning Evaluation of Large Language Models AU - Shuang Zhou AU - Wenya Xie AU - Jiaxi Li AU - Zaifu Zhan AU - Meijia Song AU - Han Yang AU - Cheyenna Espinoza AU - Lindsay Welton AU - Xinnie Mai AU - Yanwei Jin AU - Zidu Xu AU - Yuen-Hei Chung AU - Yiyun Xing AU - Meng-Han Tsai AU - Emma Schaffer AU - Yucheng Shi AU - Ninghao Liu AU - Zirui Liu AU - Rui Zhang PY - 2025 UR - https://arxiv.org/abs/2507.07988 ID - 2507.07988 ER -