TY - RPRT TI - Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions AU - Hanjie Chen AU - Zhouxiang Fang AU - Yash Singla AU - Mark Dredze PY - 2026 UR - https://arxiv.org/abs/2402.18060 ID - 2402.18060 ER -