TY - RPRT TI - AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration AU - Ruiqi Wang AU - Xinchen Wang AU - Cuiyun Gao AU - Chun Yong Chong AU - Xin Xia AU - Qing Liao PY - 2025 UR - https://arxiv.org/abs/2512.20159 ID - 2512.20159 ER -