尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

大语言模型基础

大语言模型基础 一、 大语言模型的数学本质与演进机理1.1 语言模型的形式化定义从概率论与统计学视角来看语言模型Language Model, LM的目标是建立一个计算自然语言序列概率分布的数学模型。设一段文本由按时序排列的词元Token序列组成W (w_1, w_2, w_3, ..., w_n)。根据条件概率的链式法则该序列的联合概率分布可以严格展开为P(W) P(w_1, w_2, ..., w_n) ∏ [i1 到 n] P(w_i | w_1, w_2, ..., w_{i-1})对于自回归语言模型Autoregressive LM而言其核心任务是在给定历史上下文(w_1, w_2, ..., w_{t-1})的条件下预测下一个词元w_t出现的条件概率分布P(w_t | w_1, w_2, ..., w_{t-1}) Softmax( f_θ(w_1, w_2, ..., w_{t-1}) )其中f_θ代表由数十亿至数万亿参数θ构成的深度神经网络其输出为一个维度等于词表大小Vocabulary Size的未归一化分数值Logits通过 Softmax 函数将其转化为各词元的预测概率。┌─────────────────────────────────────────────────────────────┐ │ 语言模型历史演进技术路径 │ └─────────────────────────────────────────────────────────────┘ │ 1. 统计语言模型 (N-gram) 马尔可夫假设 ➔ 矩阵稀疏 ➔ 无法建模长距离依赖 │ 2. 循环神经网络 (RNN / LSTM) 时序隐藏状态传递 ➔ 顺序依赖 ➔ 无法硬件高度并行 │ 3. 双向编码模型 (BERT 系列) 掩码语言模型 (MLM) ➔ 双向上下文 ➔ 擅长判别生成较弱 │ 4. 自回归大模型 (GPT / Llama) Decoder-Only Transformer ➔ 统一生成与理解任务1.2 为什么传统模型被 Transformer Decoder-Only 取代在深度学习发展史上NLP 领域经历过多次范式迭代N-gram 统计模型引入阶数为N的马尔可夫假设即当前词只与前N-1个词相关。缺点是无法捕获长距离语义且词表组合随N增加呈指数级爆炸。RNN / LSTM / GRU引入隐藏状态循环传递。缺点是时间步之间存在强序列依赖计算无法在 GPU 上进行时间维度的并行化且隐藏状态在长序列下存在信息瓶颈和梯度消失问题。BERTEncoder-Only 双向模型采用 Transformer 编码器结构利用上下文双向注意力机制在分类、实体识别等判别式任务上表现优异但在自由文本生成任务中自编码Masked LM机制与实际推断时逐字生成的流程存在天然脱节。Decoder-Only 架构通过单向因果掩码Causal Mask将所有自然语言处理任务统一抽象为“根据上下文预测下一个词”的自回归生成任务实现了生成能力、泛化能力与大规模并行训练效率的平衡。1.3 缩放法则Scaling Laws与涌现能力EmergenceOpenAI 在 2020 年提出的 Kaplan Scaling Law 以及 DeepMind 在 2022 年修正的 Chinchilla Scaling Law 表明模型的性能交叉熵损失 Loss与计算量Compute, C、参数量Parameters, N和训练数据集大小Dataset Size, D之间存在严格的幂律依赖关系Loss(N, D) (N_c / N)^α_N (D_c / D)^α_D L_0根据 Chinchilla 最优计算配置当计算预算增加时参数量N与训练 Token 数D应当同比例等速扩张即每增加 1 倍参数量应对应提供 1 倍训练数据通常比例约为 1:20。评估指标表现 ▲ │ ┌────── 高阶推理/代码生成/数学逻辑 │ │ (突变式提升: 涌现能力) │ ─────────┘ │ ╱ │ ────────┘ -- 临界阈值 (通常参数量 10B~100B, 数据量 1T Tokens) │ ╱ │ ───────┘ (常规感知/简单语法任务: 平滑提升) └────────────────────────────────────────────────► 训练算力 / 参数规模当模型参数量与数据量跨越特定的算力阈值时模型在多步算术、符号推理、代码生成及上下文少样本学习In-Context Learning等复杂任务上的准确率会出现非线性的跃升这种现象在学术界被称为涌现能力Emergent Abilities。二、 Tokenization文本与数值世界的桥梁计算机底层只能处理张量矩阵不能直接理解字符。分词器Tokenizer是将原始自然语言文本转化为离散整数序列Token IDs的预处理组件。2.1 分词粒度的工程权衡分词算法在粒度划分上主要有三种取舍分词粒度词表大小 (Vocab Size)序列长度 (Sequence Length)主要缺陷字符级 (Character-level)极小几百极长膨胀 3~5 倍序列过长导致注意力计算开销剧增单字符承载语义稀疏词级 (Word-level)极大数百万较短无法处理未登录词OOV, Out-Of-Vocabulary词表矩阵极大占用大量显存子词级 (Subword-level)适中32K ~ 128K适中目前工业级标准兼顾词表紧凑度与长距离语义表达2.2 主流子词算法BPEByte-Pair Encoding目前 Llama、GPT 系列普遍采用Byte-level BPE字节级字节对编码算法。BPE 算法的构建过程初始化将基础词表定义为所有单字节字符0~255 的 Byte及基础符号。统计频次遍历训练语料库统计所有相邻字符/子词对的共现频次。合并最高频对将出现频率最高的子词对例如(l, o)合并为新的词元lo并将其加入词表。迭代循环重复上述统计与合并过程直到词表大小达到预设目标如 32,000 或 128,256。# 极简 BPE 合并逻辑实现示例 import collections def get_stats(vocab): pairs collections.defaultdict(int) for word, freq in vocab.items(): symbols word.split() for i in range(len(symbols) - 1): pairs[symbols[i], symbols[i1]] freq return pairs def merge_vocab(pair, v_in): v_out {} bigram .join(pair) replacement .join(pair) for word in v_in: w_out word.replace(bigram, replacement) v_out[w_out] v_in[word] return v_out # 模拟词频语料 vocab {l o w /w: 5, l o w e r /w: 2, n e w e s t /w: 6, w i d e s t /w: 3} pairs get_stats(vocab) best_pair max(pairs, keypairs.get) vocab merge_vocab(best_pair, vocab) print(f最高频合并对: {best_pair})2.3 Byte-fallback 机制与多语言效率在处理生僻字符、表情符号Emoji或多语言混合文本时传统分词器容易生成无法识别的UNK符号。Byte-fallback 策略当遇到未在词表中收录的组合时分词器直接将其分解为底层的 UTF-8 单字节序列如\xe4\xbd\xa0。这一机制保证了词表的绝对闭合彻底消除了 OOV 现象。词表大小对模型性能有直接影响词表过小如 32K同一段中文文本切分出的 Token 数量偏多导致模型推理时需要执行更多步的解码且长文本上下文容纳的实际信息量缩水。词表过大如 128K/256K虽然压缩率高、推理步数少但 Embedding 查找层和输出 LM Head 分类层的显存开销与参数量显著增加。三、 基石架构Transformer Decoder-Only 深度解剖现代主流大语言模型如 GPT-4、Llama 3、DeepSeek、Qwen在骨干架构上高度一致均由多个堆叠的Transformer Decoder Block组成。┌─────────────────────────────────────────────────────────────┐ │ 单个 Transformer Decoder 层结构 │ └─────────────────────────────────────────────────────────────┘ │ ▼ 输入张量 X [Batch, SeqLen, HiddenDim] ┌──────────────────────────┐ │ RMSNorm 归一化 │ └────────────┬─────────────┘ ▼ ┌──────────────────────────┐ │ Q, K, V 投影 (含 RoPE) │ └────────────┬─────────────┘ ▼ ┌──────────────────────────┐ │ 因果注意力机制 (GQA / MHA)│ └────────────┬─────────────┘ ▼ ┌──────────────────────────┐ │ 残差连接 (Residual) │ ◄─── (与输入 X 相加) └────────────┬─────────────┘ ▼ ┌──────────────────────────┐ │ RMSNorm 归一化 │ └────────────┬─────────────┘ ▼ ┌──────────────────────────┐ │ SwiGLU 前馈前向网络 │ └────────────┬─────────────┘ ▼ ┌──────────────────────────┐ │ 残差连接 (Residual) │ ◄─── (与前级输出相加) └────────────┬─────────────┘ ▼ 输出传递给下一层3.1 自注意力机制Self-Attention与因果掩码自注意力机制的核心是计算序列中每个词元与其他所有词元之间的相关度权重。输入向量经过三个不同的线性变换矩阵映射分别生成查询矩阵Query, Q表示当前词元在寻找什么信息。键矩阵Key, K表示当前词元包含什么特征以供匹配。值矩阵Value, V表示当前词元实际承载的内容表征。标准缩放点积注意力Scaled Dot-Product Attention计算逻辑Attention(Q, K, V) Softmax( (Q · K^T) / √d_k M ) · V其中d_k为注意力头维度Head Dimension除以√d_k是为了防止高维向量点积过大导致 Softmax 梯度进入饱和区梯度弥散。M为因果掩码矩阵Causal Mask。在 Decoder-Only 架构中为了保证时序单向自回归特性必须将当前位置t之后的所有未来位置j t的注意力权重设置为负无穷大-inf经过 Softmax 后其对应权重变为 0从而防止模型“看到未来的答案”。import torch import torch.nn.functional as F def scaled_dot_product_attention(Q, K, V, maskNone): Q, K, V 形状: [batch_size, num_heads, seq_len, head_dim] d_k Q.size(-1) scores torch.matmul(Q, K.transpose(-2, -1)) / (d_k ** 0.5) if mask is not None: # 将掩码为 0 的未来位置填充为负无穷 scores scores.masked_fill(mask 0, float(-inf)) attention_weights F.softmax(scores, dim-1) output torch.matmul(attention_weights, V) return output, attention_weights3.2 注意力变体演进MHA ➔ MQA ➔ GQA在大模型推理阶段为了缓存历史上下文系统需要将所有历史 Token 的K和V张量保存在 GPU 显存中即KV Cache。随着并发请求数和序列长度增加KV Cache 会占用大量显存成为系统并发瓶颈。为此工业界对传统的注意力机制进行了持续优化【MHA (多头注意力)】 【GQA (分组查询注意力)】 【MQA (多查询注意力)】 Q 头: 8, KV 头: 8 Q 头: 8, KV 头: 2 (4组共享1对) Q 头: 8, KV 头: 1 (全局共享1对) Q1 Q2 Q3 Q4 Q5 Q6 Q7 Q8 Q1 Q2 Q3 Q4 Q5 Q6 Q7 Q8 Q1 Q2 Q3 Q4 Q5 Q6 Q7 Q8 │ │ │ │ │ │ │ │ ╲ ╱ ╲ ╱ ╲ ╱ ╲ ╱ ╲ ╲ │ │ │ │ ╱ ╱ K1 K2 K3 K4 K5 K6 K7 K8 K1 K2 K3 K4 KV1 V1 V2 V3 V4 V5 V6 V7 V8 V1 V2 V3 V4 (所有 Q 共享单组 KV) (显存消耗最大表达力最强) (显存与性能的最佳平衡点) (显存极低表达力轻微下降)MHAMulti-Head Attention每个 Query 头对应一组独立的 Key 和 Value 头。KV Cache 显存占用最高。MQAMulti-Query Attention所有 Query 头共享同一组 Key 和 Value 头。KV Cache 显存占用降低至1 / num_heads但可能会在复杂任务中损失一定的表征精度。GQAGrouped-Query Attention折中方案如 Llama 3、DeepSeek 所采用。将 Query 头分为若干组如 8 组每组内的 Query 头共享一组 Key 和 Value 头。在保持接近 MHA 模型质量的同时将 KV Cache 显存占用降低数倍。3.3 旋转位置编码RoPE, Rotary Position EmbeddingTransformer 内部的注意力计算具有置换不变性Permutation Invariance因此必须向词向量中注入位置编码Positional Encoding。早期的绝对位置编码如可学习位置向量、正余弦静态编码在处理超出训练长度的外推时表现不佳。当前行业普遍采用 Su 等人提出的RoPE旋转位置编码。RoPE 的核心思想通过绝对位置编码的形式实现相对位置编码的效果。在二维平面上对于位于位置m的向量x (x_1, x_2)将其乘以一个旋转正交矩阵R_θ,m | cos(mθ) -sin(mθ) | | sin(mθ) cos(mθ) |当计算位置m的 Query 向量与位置n的 Key 向量的点积时两者的内积结果仅取决于相对位置差值m - n R_θ,m · Q, R_θ,n · K Q^T · R_θ,(n - m) · KRoPE 具备自然的衰减特性相对距离越远内积期望值越小并且便于通过插值Linear Interpolation、NTK-Aware Scaling、YaRN将上下文窗口扩展至 32K、128K 乃至 1M。3.4 归一化与激活函数优化现代 LLM 在经典 Transformer 结构基础上进行了两个关键的基础组件替换1. RMSNormRoot Mean Square Normalization传统的 LayerNorm 需要计算均值Mean和方差Variance两个统计量。研究表明LayerNorm 的核心缩放特性来自于均方根均值中心化对模型稳定性的贡献微乎其微。RMSNorm 计算公式RMS(x) sqrt( (1 / d) * ∑ [i1 到 d] (x_i)^2 ε ) y (x / RMS(x)) * γ去除了均值计算后RMSNorm 将训练与推理速度提升了 10%~50%且数值稳定性保持不变。2. SwiGLU 激活函数传统的 FFN前馈全连接层采用 ReLU 或 GELU。现代 LLM 广泛采用SwiGLUSwish Gated Linear Unit门控线性单元架构SwiGLU(x) ( x · W_gate * Sigmoid(x · W_gate * β) ) ⊗ ( x · W_up ) · W_down引入门控机制后模型参数的表达容量显著提升在相同参数规模下收敛速度更快、下游指标表现更优。四、 大模型的完整训练流水线从零构建一个可商用的大模型必须经历严格的三阶段生命周期。┌────────────────────────────────────────────────────────────────────────┐ │ 大模型三阶段训练全景路线图 │ └────────────────────────────────────────────────────────────────────────┘ │ 1. 预训练阶段 (Pre-training) 海量无标注文本 ➔ 自监督预测下一个词 ➔ 基座模型 (Base Model) │ (消耗 95% 以上的总算力与数据) ▼ 2. 监督微调阶段 (SFT) 高质量指令问答对 ➔ 学习问答对话范式 ➔ 指令模型 (Instruct Model) │ (数据量通常在 10万 ~ 百万级高质量对) ▼ 3. 人类偏好对齐 (RLHF / DPO) 人类偏好打分 ➔ 强化学习/直接偏好优化 ➔ 安全对齐模型 (Chat Model) (抑制有害言论、减少幻觉、对齐人类价值观)4.1 第一阶段海量数据预训练Pre-training预训练是大模型获取通用语言理解能力、逻辑结构与世界常识的最核心阶段。1. 数据工程流水线Data Pipeline高质量的语料数据是大模型性能的决定性因素。通常包括以下处理步骤数据收集抓取网页Common Crawl、权威图书、学术期刊论文arXiv、开源代码仓库GitHub、百科词条等。文本清洗与格式提取去除 HTML 标签、过滤无意义字符与低质广告文本。大规模去重Deduplication利用 MinHash LSH 或 Exact Substring Matching 算法去除重复网页避免模型死记硬背重复文本提升泛化能力。安全过滤与隐私擦除过滤涉黄、暴力言论脱敏身份证、信用卡、手机号等 PII 隐私数据。2. 训练目标与损失函数预训练阶段采用自监督的自回归交叉熵损失函数Cross-Entropy Loss。设词表大小为V真实下一个 Token 的独热编码为y_t模型预测概率分布为p_tLoss - (1 / T) * ∑ [t1 到 T] log( p_t(w_t) )3. 分布式并行训练策略当模型参数量达到 70B 甚至更大时单个 GPU 显存如 A100/H100 80GB完全无法容纳模型参数、梯度及优化器状态AdamW 优化器每个参数需占用 16 字节显存。必须组合使用多种分布式并行技术数据并行DDP / ZeROZeROZero Redundancy Optimizer技术将优化器状态ZeRO-1、梯度ZeRO-2和模型参数ZeRO-3分片切分存储于各个 GPU 节点。张量并行Tensor Parallelism, TP在单个算子内部如将矩阵乘法Y X · W按列或按行切分进行分布式计算Megatron-LM 架构。流水线并行Pipeline Parallelism, PP将模型的不同层Layer按顺序分配到不同 GPU 上流水线执行。4.2 第二阶段监督指令微调SFT, Supervised Fine-Tuning经过预训练的基座模型Base Model只具备“文字续写”能力不理解人类的“提问-回答”指令交互模式。SFT 阶段使用人工标注或大模型合成的高质量格式数据(Instruction, Input, Response)在保持预训练模型权重基础的前提下让模型学会理解指令、遵循格式约束并扮演特定助手角色。参数高效微调PEFT / LoRA在企业落地场景中全量参数微调Full Fine-Tuning成本极高。Edward Hu 等人提出的LoRALow-Rank Adaptation是目前最广泛采用的高效微调技术。LoRA 核心原理假定模型权重在特定任务适应过程中的参数更新量矩阵ΔW具有极低的“内在秩Intrinsic Rank”。对于原始预训练冻结权重W_0 (d × k)将其更新量分解为两个低秩矩阵的乘积W W_0 ΔW W_0 (B · A) * (α / r)其中矩阵A的维度为r × k采用高斯分布初始化矩阵B的维度为d × r初始化为全 0r为设定的秩Rank通常设为 8、16、64且r min(d, k)α为缩放因子常数。输入 X ├──► [ 冻结的原始预训练权重 W_0 (d × k) ] ───► 输出 Y_base ──┐ │ ├──► 最终输出 Y Y_base Y_lora └──► [ 降维矩阵 A (r × k) ] ──► [ 升维矩阵 B (d × r) ] ──► Y_lora ──┘ (仅训练可学习的 A 和 B参数量仅占原模型的 0.1%~1%)LoRA 的核心优势训练时无需更新海量原参数仅保存微小体积的 Adapter 权重权重文件通常几十兆字节且在推理阶段可直接通过矩阵加法合并回原始权重W W_0 B · A不增加任何线上推理延迟。4.3 第三阶段人类偏好对齐Alignment: RLHF 与 DPO微调后的模型虽然能回答问题但可能输出包含虚假幻觉、危险攻击性言论或违背人类伦理的内容。对齐技术的目标是让模型输出符合3H 标准Helpful 有用、Honest 诚实、Harmless 无害。1. RLHF基于人类反馈的强化学习经典三步法第一步收集提示词由模型生成多个候选输出人类标注员对候选答案按质量进行排序打分。第二步使用排序数据训练一个奖励模型Reward Model, RM该模型输入一段问答输出一个标量分数值用以模拟人类的评分标准。第三步使用PPOProximal Policy Optimization强化学习算法将 LLM 视作策略Policy以奖励模型得分最高为目标进行迭代更新同时引入 KL 散度惩罚项防止模型偏离原始 SFT 模型过远。2. DPODirect Preference Optimization直接偏好优化由于 RLHF 需要同时维护 SFT 模型、Actor 模型、Critic 模型、Reference 模型以及 Reward 模型显存开销极大且强化学习训练过程极其敏感脆弱。Rafailov 等人提出的DPO算法通过数学推导证明可以绕过显式训练独立奖励模型的步骤直接利用偏好数据对(x, y_w, y_l)y_w为人类偏好胜出答案y_l为人类拒绝劣质答案优化策略模型。DPO 损失函数形式Loss_DPO - E [ log( Sigmoid( β * log( π_θ(y_w | x) / π_ref(y_w | x) ) - β * log( π_θ(y_l | x) / π_ref(y_l | x) ) ) ) ]DPO 大幅简化了对齐流水线具备更强的收敛稳定性与训练效率已成为当前开源大模型对齐的主流方案。五、 推理采样与解码策略Decoding Strategies当模型计算出下一个 Token 的概率分布向量后解码器必须依据特定的采样策略选出最终输出的 Token。不同的策略直接决定了输出文本的逻辑确定性与创造性。模型输出 Logits ──► 温度缩放 (Temperature) ──► Top-K / Top-P 截断过滤 ──► Softmax 采样 ──► 输出最终 Token5.1 采样控制参数详解Greedy Search贪婪搜索每一步均强制选取概率最高的单个 Tokenargmax P(w_t)。输出完全确定、可复现但在长文本生成中容易陷入局部最优和死循环重复。Temperature采样温度T在执行 Softmax 之前对未归一化的 Logitsz_i进行平缩放P(w_i) exp(z_i / T) / ∑_j exp(z_j / T)当T - 0时极大值被无限放大概率分布退化为 Dirac delta 函数等价于贪婪搜索适用于代码、数学推理。当T 1.0时高概率与低概率之间的差距被压缩概率分布趋于平坦增加输出的多样性与创造力但过高会导致语句语病和胡言乱语。Top-K 采样仅保留概率最高的前K个候选词其余候选词的概率强制清零并重新归一化。Top-P核采样, Nucleus Sampling将所有候选词按概率从大到小降序排列并累加仅保留累积概率达到阈值P如 0.9的最小候选子集。与 Top-K 相比Top-P 能够根据上下文动态调整候选词池的大小。Presence / Frequency Penalty惩罚因子Frequency Penalty根据词元在已生成文本中出现的绝对频次按比例扣减 Logits抑制高频无意义字词的单调重复。Presence Penalty只要词元在历史文本中出现过一次就给予固定数值的惩罚鼓励模型引入新的话题与词汇。六、 高效架构与前沿演进大语言模型的基础架构正在向更低的算力消耗、更长的上下文承载以及更深度的逻辑推理方向演变。┌─────────────────────────────────────────────────────────────┐ │ 大语言模型前沿技术架构演化 │ └─────────────────────────────────────────────────────────────┘ │ 1. 混合专家架构 (MoE) 稀疏条件激活 ➔ 提升参数容量同时保持固定推理算力 │ 2. 显存 IO 极致优化 FlashAttention-1/2/3 ➔ 分块计算 ➔ 消除 HBM 读写瓶颈 │ 3. 推理期计算 (Reasoning) 思维链强化学习 ➔ Test-time Compute ➔ 自我反思与纠错6.1 混合专家模型MoE, Mixture of Experts在传统的稠密模型Dense Model中每个 Token 必须激活全量参数进行前向传播。混合专家模型MoE如 DeepSeek-V3、Mixtral引入了稀疏条件激活Sparse Activation机制将 Transformer 中的标准 FFN 层替换为一组并行的专家前馈网络Expert_1, Expert_2, ..., Expert_E。引入一个轻量级的门控路由网络Gating Router计算每个 Token 与各个专家的匹配得分。针对每个 Token仅动态挑选排名前K个如 8 个专家中激活 2 个最匹配的专家参与计算其余专家保持静默。输入 Token X │ ▼ [ 门控路由网络 Gating Router ] ──► 计算匹配权重: [Expert 2 (0.7), Expert 5 (0.3)] │ ├─────────────────────────────────┐ ▼ (仅路由到指定 Top-K 专家) ▼ [ Expert 2 (FFN) ] [ Expert 5 (FFN) ] │ │ └────────────────┬────────────────┘ ▼ 加权求和 输出 Y 0.7 * E_2(X) 0.3 * E_5(X)MoE 核心收益在大幅提升模型总参数量参数容量与知识存储空间的同时使单 Token 推理所需的实际浮点运算量FLOPs和延迟保持在极低水平。6.2 显存 IO 极致优化FlashAttention在处理超长上下文时注意力矩阵S Q · K^T的尺寸为[SeqLen, SeqLen]。当序列长度达到 128K 时物化该矩阵需要消耗数百 GB 显存且频繁在 GPU 显存SRAM 与 HBM之间读写数据会导致显存带宽严重饱和。Tri Dao 提出的FlashAttention从底层硬件架构出发重构了 Attention 的计算逻辑分块计算Tiling将输入矩阵Q, K, V切分为适合 GPU 片上高速 SRAM 缓存的小块Block。在线 SoftmaxOnline Softmax利用动态统计量缩放技巧在不物化整个大注意力矩阵的前提下逐步累加中间结果。核函数融合Kernel Fusion将矩阵乘法、Mask、Softmax 和 Dropout 操作融合在一个 Triton/CUDA Kernel 中完成消除对低速 HBM 显存的多余读写。FlashAttention 在数学计算结果上与标准注意力完全等价但将运行速度提升了数倍并将 Attention 显存复杂度从O(N^2)彻底降为O(N)。6.3 深度推理范式转移推理期算力Test-Time Compute以 OpenAI o1/o3 及 DeepSeek-R1 为代表的新一代推理模型Reasoning Models代表了大模型底层的最新演进方向传统 LLM将全部思考过程压缩在单次前向传递中遇到超难问题时容易产生跳步和逻辑谬误。推理模型通过大规模强化学习RL诱导模型在输出最终答案之前在内部生成极长、包含自我纠错、多路径尝试与推导验证的思维链Chain of Thought, CoT。这一突破开辟了全新的扩展维度——推理期扩展定律Inference Scaling Law对于高难度科学与逻辑问题通过增加模型在推理阶段的思考时间与计算步数Test-time Compute模型的准确率可以持续突破原有参数规模的上限。七、 总结与技术全景对照表大语言模型并不是神秘的不可知黑盒而是一套建立在严格概率统计、矩阵微积分与大规模分布式并行工程之上的精密系统。模块分层核心技术 / 关键组件解决的核心工程与数学问题数学基础自回归联合概率链式法则统一序列理解与生成任务建立基于概率的 Next-Token 预测机制数据与编码Byte-level BPE Byte-fallback建立紧凑的离散语义映射消除未登录词OOV并兼顾多语言效率计算骨干Decoder-Only RoPE GQA SwiGLU实现硬件友好的高吞吐矩阵并行优化长上下文相对位置感知与显存占用生命周期Pre-training ➔ SFT ➔ RLHF / DPO依次完成通识知识获取、问答对话指令遵循与人类价值安全对齐推理系统KV Cache Continuous Batching FlashAttention降低长文本显存 IO 开销与时间复杂度支持高并发低延迟流式交付前沿演进MoE 稀疏激活 推理期强化学习 (RL-driven CoT)突破算力与参数规模瓶颈实现从简单文本续写到复杂逻辑推理的跃迁理解大模型的底层基础是开发者在模型选型、系统微调、RAG 检索增强设计以及 Agent 智能体系统架构中做出正确工程决策的前提。随着硬件架构与算法机制的持续演进LLM 正在从单纯的自然语言处理工具演进为下一代计算平台的智能内核。
返回列表