TY - RPRT TI - When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation AU - Bian Sun AU - Zhenjian Wang AU - Orvill de la Torre AU - Zirui Wang PY - 2026 UR - https://arxiv.org/abs/2603.00314 ID - 2603.00314 ER -