TY - RPRT TI - Benchmarking Failures in Tool-Augmented Language Models AU - Eduardo TreviƱo AU - Hugo Contant AU - James Ngai AU - Graham Neubig AU - Zora Zhiruo Wang PY - 2025 UR - https://arxiv.org/abs/2503.14227 ID - 2503.14227 ER -