@misc{indiciae8547a3c8a537, title = {SWARM Parallelism: Training Large Models Can Be Surprisingly Communication-Efficient}, author = {Max Ryabinin and Tim Dettmers and Michael Diskin and Alexander Borzunov}, year = {2023}, url = {https://arxiv.org/abs/2301.11913}, note = {Source identifier: 2301.11913} }