@misc{indiciaef9db8ed2293b, title = {Distributed SLIDE: Enabling Training Large Neural Networks on Low Bandwidth and Simple CPU-Clusters via Model Parallelism and Sparsity}, author = {Minghao Yan and Nicholas Meisburger and Tharun Medini and Anshumali Shrivastava}, year = {2022}, url = {https://arxiv.org/abs/2201.12667}, note = {Source identifier: 2201.12667} }