@misc{indiciae8e8cad501fbf, title = {Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM}, author = {Deepak Narayanan and Mohammad Shoeybi and Jared Casper and Patrick LeGresley and Mostofa Patwary and Vijay Anand Korthikanti and Dmitri Vainbrand and Prethvi Kashinkunti and Julie Bernauer and Bryan Catanzaro and Amar Phanishayee and Matei Zaharia}, year = {2021}, url = {https://arxiv.org/abs/2104.04473}, note = {Source identifier: 2104.04473} }