TY - RPRT TI - Tricky$^2$: Towards a Benchmark for Evaluating Human and LLM Error Interactions AU - Cole Granger AU - Dipin Khati AU - Daniel Rodriguez-Cardenas AU - Denys Poshyvanyk PY - 2026 DO - 10.1145/3793655.3793709 UR - https://arxiv.org/abs/2601.18949 ID - 2601.18949 ER -