TY - RPRT TI - Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference AU - Qingyuan Li AU - Bo Zhang AU - Liang Ye AU - Yifan Zhang AU - Wei Wu AU - Yerui Sun AU - Lin Ma AU - Yuchen Xie PY - 2024 UR - https://arxiv.org/abs/2412.04964 ID - 2412.04964 ER -