arXiv · 2503.23186
Optimizing Distributed Training Approaches for Scaling Neural Networks
Abstract
This paper presents a comparative analysis of distributed training strategies for large-scale neural networks, focusing on data parallelism, model parallelism, and hybrid approaches. We evaluate these strategies on image classification tasks using the CIFAR-100 dataset, measuring training time, convergence rate, and model accuracy. Our experimental results demonstrate that hybrid parallelism achieves a 3.2x speedup compared to single-device training while maintaining comparable accuracy. We propose an adaptive scheduling algorithm that dynamically switches between parallelism strategies based on network characteristics and available computational resources, resulting in an additional 18% improvement in training efficiency.
Explore related subjects
Keep this discovery
Vishnu Vardhan Baligodugula, Fathi Amsaad. 2025-03-29. Optimizing Distributed Training Approaches for Scaling Neural Networks. https://arxiv.org/abs/2503.23186
Cite the original work for its findings. Save a collection to share your selection of sources.