TY - RPRT TI - Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight AU - Anupam Purwar AU - Shashank Singh AU - Kritika Srivastava PY - 2026 UR - https://arxiv.org/abs/2608.24314 ID - 2608.24314 ER -