TY - RPRT TI - Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation AU - Lingyue Fu AU - Bolun Zhang AU - Hao Guan AU - Yaoming Zhu AU - Lin Qiu AU - Weiwen Liu AU - Xuezhi Cao AU - Xunliang Cai AU - Weinan Zhang AU - Yong Yu PY - 2026 DO - 10.65109/hjfb4234 UR - https://arxiv.org/abs/2510.24358 ID - 2510.24358 ER -