TY - RPRT TI - How Transformers Utilize Multi-Head Attention in In-Context Learning? A Case Study on Sparse Linear Regression AU - Xingwu Chen AU - Lei Zhao AU - Difan Zou PY - 2024 UR - https://arxiv.org/abs/2408.04532 ID - 2408.04532 ER -