@misc{indiciae802afa32f4ae, title = {Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization}, author = {Zhanda Zhu and Christina Giannoula and Muralidhar Andoorveedu and Qidong Su and Karttikeya Mangalam and Bojian Zheng and Gennady Pekhimenko}, year = {2025}, doi = {10.1145/3689031.3717461}, url = {https://arxiv.org/abs/2503.19050}, note = {Source identifier: 2503.19050} }