@misc{indiciaef7faa6a4bec2, title = {Gated Linear Attention Transformers with Hardware-Efficient Training}, author = {Songlin Yang and Bailin Wang and Yikang Shen and Rameswar Panda and Yoon Kim}, year = {2024}, url = {https://arxiv.org/abs/2312.06635}, note = {Source identifier: 2312.06635} }