@misc{indiciae25e710c24188, title = {Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking}, author = {William Philipp and Finn Fassbender and Daniel Fister and Thorsten Langer and Martje G. Pauly and Rebecca Herzog and Markus A. Hobert and Theresa Paulus and Alexander Baumann and Chi Wang Ip and Lukas L. Goede and Johanna Reimer and Sebastian Löns and Ronald Böck and Sebastian Fudickar}, year = {2026}, url = {https://arxiv.org/abs/2607.01103}, note = {Source identifier: 2607.01103} }