TY - RPRT TI - AI Sandbagging: Language Models can Strategically Underperform on Evaluations AU - Teun van der Weij AU - Felix Hofstätter AU - Ollie Jaffe AU - Samuel F. Brown AU - Francis Rhys Ward PY - 2025 UR - https://arxiv.org/abs/2406.07358 ID - 2406.07358 ER -