尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Pier: Efficient Large Language Model pretraining with Relaxed Global Communication

Pier: Efficient Large Language Model pretraining with Relaxed Global Communication 一、文章主要内容总结本文针对大型语言模型(LLM)预训练中全局通信(如all-reduce、all-gather)成为性能瓶颈的问题,提出了一种高效可扩展的优化框架Pier。该框架基于DiLoCo的双层优化结构(组内局部优化器+组间全局优化器),通过改进技术解决了DiLoCo存在的性能下降问题,并优化了并行架构以支持复杂训练场景。核心内容包括:问题背景:LLM预训练依赖大规模分布式GPU集群,传统优化器(如AdamW)的全局通信导致扩展效率低下(如32 A100 GPU上GPT-2 1.5B训练扩展效率仅42.7%);现有低通信方法(如梯度稀疏、局部SGD)要么提速有限(10-30%),要么存在模型性能退化(如DiLoCo)。核心技术:动量预热(Momentum Warmup):在训练初期(前10%迭代)使用AdamW并累积动量,避免切换优化器时的梯度振荡。动量衰减(Momentum Decay):切换到DiLoCo后,通过分阶段调整动量系数(0.99→0.95→0.9),实现从AdamW到DiLoCo的平滑过渡。2D并行架构:支持数据并行(DP)与张量并行(TP)的叠加,利用节点内高带宽链路(如NVLink)减少组内通信开销,全局通信仅周期性触发。实验验证:在NERSC Perlmutter(A100 GPU)和TACC Vista(GH200 Superchip)集群上,基于G
返回列表