尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

LLM 技术全景笔记:从架构到推理的硬核拆解

LLM 技术全景笔记:从架构到推理的硬核拆解 大语言模型LLM是一个极其庞杂的领域我将为你构建一个系统性的知识框架从底层原理到顶层应用层层递进。这份梳理既涵盖核心概念也包含前沿技术细节。第一层基础概念与核心范式LLM的本质定义规模定律模型参数规模千亿级、训练数据量万亿Token、计算量Flops三者共同增长时模型性能会可预测地线性提升。涌现能力当模型规模突破某个阈值如百亿参数会突然出现小模型不具备的复杂推理、上下文学习等能力。自回归生成本质是概率模型逐个预测下一个Token直到生成终止符。核心架构Transformer的进化解码器架构Decoder-only当前主流GPT系列、Llama通过因果掩码实现单向注意力擅长文本生成。核心组件深度解析位置编码从绝对位置Transformer原版到相对位置RoPE旋转位置编码RoPE成为Llama、PaLM等主流选择能更好处理长文本外推。注意力机制变体MHA多头注意力标准模式但KV Cache占用显存大。GQA分组查询注意力Llama 3采用在MHA和MQA间折中平衡推理速度与效果。MLA多潜注意力DeepSeek采用压缩KV Cache大幅降低显存占用。前馈网络FFN进化从传统FFN到SwiGLU激活函数Llama使用门控线性单元显著提升效果。归一化方法从Post-Norm原始Transformer转向Pre-Norm再到RMSNorm去除均值中心化计算更高效。第二层训练全流程三阶段这是LLM能力的来源分为三个核心阶段预训练Pre-training—— 奠基阶段数据工程数据清洗去重、过滤质量、数据配比不同领域语料的比例混合、TokenizationBPE/SentencePiece算法。海量无监督学习利用互联网海量文本通过自监督学习预测下一个词获取世界知识和语言能力。关键挑战训练稳定性Loss Spike处理、分布式并行3D并行数据并行流水线并行张量并行。监督微调SFT—— 训练对齐使用高质量的指令-应答对数据进行训练将“基座模型”转化为“对话模型”。关键技巧微调时只计算应答部分的Loss忽略指令部分防止干扰模型的理解能力。偏好对齐RLHF / DPO—— 价值观对齐RLHF基于人类反馈的强化学习训练奖励模型RM打分用PPO算法优化模型输出。流程复杂但效果上限高。DPO直接偏好优化2023年提出的替代方案绕过训练奖励模型直接用偏好数据通过数学推导更新模型训练更稳定、成本更低已成为主流选择。第三层上下文与推理增强解决“幻觉”和“时效”问题检索增强生成RAG经典RAGQuery - 向量检索 - 召回相关文档 - 拼接Prompt - 生成。高级RAG进化HyDE假设性文档嵌入先让LLM生成一个假设性答案再用该答案去检索提升语义匹配度。Self-RAG模型自我反思通过特殊Token判断是否需要检索、检索结果是否相关、生成是否可信。CRAG纠正性RAG对检索结果进行质量评估如果差则启动网络搜索兜底。长上下文技术Long Context当前SOTA模型已支持1M-10M上下文窗口。关键技术位置插值PI将位置索引压缩以适配训练时的范围。NTK-aware缩放基于神经正切核理论对不同频率的维度进行不同幅度的缩放更好保留高频信息。注意力机制优化使用FlashAttention V2/V3技术加速长文本计算通过分块和IO优化避免显存溢出。第四层高效参数微调PEFT在资源有限时无需全量微调。LoRA低秩适配在原始权重旁插入低秩矩阵A和B只训练这两个小矩阵再与原权重相加。QLoRA进一步引入4-bit量化可在单卡24G显存上微调百亿模型。Adapter在Transformer层间插入小型神经网络模块。Prefix Tuning在输入前添加可训练的连续向量虚拟Token。第五层推理优化部署加速KV Cache缓存已生成Token的Key和Value向量避免重复计算是推理优化的基础。量化QuantizationGPTQ训练后量化对权重进行逐层压缩。AWQ激活感知量化保留1%对激活值影响大的重要权重不量化保护模型性能。FP8推理NVIDIA H100等新硬件支持精度损失小。投机采样Speculative Decoding用小模型快速生成多个Token大模型并行验证可将推理速度提升2-3倍。第六层前沿挑战与最新技术Mixture of Experts (MoE)将FFN层替换为多个专家网络由路由网络动态选择Top-K个专家计算。在保持总参数量巨大的同时激活参数量不变如Mistral 8x7B实际激活仅约12B平衡了效果与成本。推理时扩展Test-Time ScalingOpenAI o1模型的核心思路不单纯依赖模型参数增加而是在推理阶段增加思维链CoT的搜索和验证长度。关键技术过程监督奖励模型PRM对推理的每一步而非最终结果打分引导模型探索更多解题路径树搜索。Agent智能体将LLM作为大脑赋予其工具调用能力如搜索引擎、代码解释器、API接口。ReAct框架交替进行Reasoning推理和Acting行动让模型边思考边执行。多智能体协作如AutoGen框架不同角色程序员、评审员、执行员协同完成任务。第七层评估体系基座能力MMLU多任务语言理解、HellaSwag常识推理、GSM8K数学推理。对齐能力MT-Bench多轮对话、AlpacaEval指令遵循。安全与幻觉TruthfulQA事实性、HaluEval幻觉检测。
返回列表