TY - RPRT TI - Softmax $\geq$ Linear: Transformers may learn to classify in-context by kernel gradient descent AU - Sara Dragutinović AU - Andrew M. Saxe AU - Aaditya K. Singh PY - 2025 UR - https://arxiv.org/abs/2510.10425 ID - 2510.10425 ER -