TY - RPRT TI - Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients AU - Armin Berger AU - Manuela Bergau AU - Helen Schneider AU - Saad Ahmad AU - Tom Anglim Lagones AU - Gianluca Brugnara AU - Martha Foltyn-Dumitru AU - Kai Schlamp AU - Philipp Vollmuth AU - Rafet Sifa PY - 2026 UR - https://arxiv.org/abs/2512.23090 ID - 2512.23090 ER -