初探muP:超参数的跨模型尺度迁移规律05

发布时间:2026/7/30 11:25:29

初探muP:超参数的跨模型尺度迁移规律05 初探muP:超参数的跨模型尺度迁移规律众所周知,完整训练一次大型LLM的成本是昂贵的,这就决定了我们不可能直接在大型LLM上反复测试超参数。一个很自然的想法是希望可以在同结构的小模型上仔细搜索超参数,找到最优组合后直接迁移到大模型上。尽管这个想法很朴素,但要实现它并不平凡,它需要我们了解常见的超参数与模型尺度之间的缩放规律,而muP正是这个想法的一个实践。muP,有时也写μP,全名是Maximal Update Parametrization,出自论文《Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer》,随着LLM训练的普及,它逐渐已经成为了科学炼丹的事实标配之一。方法大意在接入主题之前,必须先吐槽一下muP原论文写得实在太过晦涩,并且结论的表达也不够清晰,平白增加了不少理解难度,所以接下来笔者尽量以一种(自认为)简明扼要的方式来复现muP的结论。先说结论,muP主要研究超参数跨模型尺度的迁移规律。这里有几个关键词:1、超参数,目前主要指学习率;2、模型尺度,目前主要是模型宽度;3、这里的核心是“迁移”。

相关新闻