
一、先搞懂:Dropout 基础原理(传统小模型时代)1. 核心机制Dropout 2012年由Hinton提出,训练阶段以固定概率随机把神经元激活置0;推理阶段全部神经元启用,并做尺度缩放保证输出均值不变(Inverted Dropout)。2. 两大作用(小模型刚需)打破神经元共适应:防止少量神经元绑定、死记训练噪声,强迫网络学习通用特征;隐式集成效果:每个batch训练一个稀疏子网络,最终等价大量子网络投票,降低方差、缓解过拟合。3. 传统Transformer用法(BERT/GPT2)早期模型会在4个位置加dropout:Embedding输入层dropoutAttention权重dropout(DropAttn)Attention输出残差后dropoutMLP输出残差后dropout典型配置:p=0.1~0.3,BERT-base标准0.1。二、现在主流LLM(Llama2/3、Mistral、GPT3+)预训练几乎删掉Dropout的6大核心原因1. 根本前提:大模型预训练几乎不存在过拟合,Dropout“无病吃药”(1)数据规模天然是最强正则现代LLM预训练数据是万亿token级别,单epoch训练(每个文本样本只看一遍,极少重复):