TY - RPRT TI - SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading AU - Tu Anh Dinh AU - Carlos Mullov AU - Leonard Bärmann AU - Zhaolin Li AU - Danni Liu AU - Simon Reiß AU - Jueun Lee AU - Nathan Lerzer AU - Fabian Ternava AU - Jianfeng Gao AU - Tobias Röddiger AU - Alexander Waibel AU - Tamim Asfour AU - Michael Beigl AU - Rainer Stiefelhagen AU - Carsten Dachsbacher AU - Klemens Böhm AU - Jan Niehues PY - 2024 UR - https://arxiv.org/abs/2406.10421 ID - 2406.10421 ER -