TY - RPRT TI - Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm AU - Jinrui Zhang AU - Chaodong Xiao AU - Aoqi Wu AU - Xindong Zhang AU - Lei Zhang PY - 2026 UR - https://arxiv.org/abs/2602.11543 ID - 2602.11543 ER -