@misc{indiciae72925a956b7e, title = {Medical Large Language Model Benchmarks Should Prioritize Construct Validity}, author = {Ahmed Alaa and Thomas Hartvigsen and Niloufar Golchini and Shiladitya Dutta and Frances Dean and Inioluwa Deborah Raji and Travis Zack}, year = {2025}, url = {https://arxiv.org/abs/2503.10694}, note = {Source identifier: 2503.10694} }