TY - RPRT TI - Why Stop at One Error? Benchmarking LLMs as Data Science Code Debuggers for Multi-Hop and Multi-Bug Errors AU - Zhiyu Yang AU - Shuo Wang AU - Yukun Yan AU - Yang Deng PY - 2025 UR - https://arxiv.org/abs/2503.22388 ID - 2503.22388 ER -