@misc{indiciaee9d0048ffc09, title = {Automating Expert-Level Medical Reasoning Evaluation of Large Language Models}, author = {Shuang Zhou and Wenya Xie and Jiaxi Li and Zaifu Zhan and Meijia Song and Han Yang and Cheyenna Espinoza and Lindsay Welton and Xinnie Mai and Yanwei Jin and Zidu Xu and Yuen-Hei Chung and Yiyun Xing and Meng-Han Tsai and Emma Schaffer and Yucheng Shi and Ninghao Liu and Zirui Liu and Rui Zhang}, year = {2025}, url = {https://arxiv.org/abs/2507.07988}, note = {Source identifier: 2507.07988} }