@misc{indiciae082d049823b4, title = {Why Does Sharpness-Aware Minimization Generalize Better Than SGD?}, author = {Zixiang Chen and Junkai Zhang and Yiwen Kou and Xiangning Chen and Cho-Jui Hsieh and Quanquan Gu}, year = {2023}, url = {https://arxiv.org/abs/2310.07269}, note = {Source identifier: 2310.07269} }