TY - RPRT TI - How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability AU - Shawn Im AU - Changdae Oh AU - Zhen Fang AU - Sharon Li PY - 2026 UR - https://arxiv.org/abs/2601.19208 ID - 2601.19208 ER -