@misc{indiciae2cce16646ed4, title = {Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining}, author = {Houyi Li and Wenzhen Zheng and Qiufeng Wang and Hanshan Zhang and Zili Wang and Shijie Xuyang and Yuantao Fan and Zhenyu Ding and Haoying Wang and Ning Ding and Shuigeng Zhou and Xiangyu Zhang and Daxin Jiang}, year = {2025}, url = {https://arxiv.org/abs/2503.04715}, note = {Source identifier: 2503.04715} }