TY - RPRT TI - FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs AU - Saeed Mohammadzadeh AU - Erfan Hamdi AU - Joel Shor AU - Emma Lejeune PY - 2026 UR - https://arxiv.org/abs/2512.20732 ID - 2512.20732 ER -