尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

06-大语言模型(LLM)与应用——大模型基础与演进

06-大语言模型(LLM)与应用——大模型基础与演进 大模型基础与演进GPT系列、LLaMA、Claude、模型架构对比一、大语言模型概述1.1 什么是大语言模型importnumpyasnpimportmatplotlib.pyplotaspltfrommatplotlib.patchesimportRectangle,FancyBboxPatchimportwarnings warnings.filterwarnings(ignore)print(*60)print(大语言模型Large Language Model, LLM)print(*60)# LLM规模对比fig,axesplt.subplots(1,2,figsize(14,6))# 模型规模演进ax1axes[0]models[BERT\n(2018),GPT-2\n(2019),GPT-3\n(2020),LLaMA\n(2023),GPT-4\n(2023)]params[0.34,1.5,175,65,1800]# 参数量Bcolors[lightblue,lightgreen,lightcoral,lightyellow,lightpink]barsax1.bar(models,params,colorcolors)ax1.set_ylabel(参数量 (B))ax1.set_title(大语言模型规模演进)ax1.set_yscale(log)forbar,pinzip(bars,params):ax1.text(bar.get_x()bar.get_width()/2,bar.get_height()10,f{p}B,hacenter,vabottom,fontsize9)# 规模定律ax2axes[1]ax2.axis(off)ax2.set_title(规模定律 (Scaling Laws),fontsize11)scaling_text 规模定律 (Kaplan et al., 2020): 性能 ∝ (参数量)^α × (数据量)^β × (计算量)^γ 关键发现: • 模型越大 → 性能越好 • 数据越多 → 性能越好 • 计算越多 → 性能越好 经验公式: L ≈ (C / 10^21)^{-0.05} 其中: • L: 测试损失 • C: 计算量 (FLOPs) ax2.text(0.05,0.95,scaling_text,transformax2.transAxes,fontsize9,verticalalignmenttop,fontfamilymonospace)plt.suptitle(大语言模型规模演进,fontsize14)plt.tight_layout()plt.show()print(\n 大语言模型定义:)print( - 参数量 10亿的神经网络模型)print( - 在海量文本上预训练)print( - 具备强大的语言理解和生成能力)print( - 涌现能力: 推理、代码生成、多任务学习)二、GPT系列演进2.1 GPT-1/2/3/4演进defgpt_evolution():GPT系列演进print(\n*60)print(GPT系列演进)print(*60)fig,axplt.subplots(figsize(14,8))ax.axis(off)# 时间线versions[(GPT-1\n(2018),0.08,0.7,117M,无监督预训练 监督微调),(GPT-2\n(2019),0.3,0.7,1.5B,Zero-shot学习),(GPT-3\n(2020),0.55,0.7,175B,Few-shot/In-context learning),(GPT-3.5\n(2022),0.75,0.7,175B,指令微调 RLHF),(GPT-4\n(2023),0.92,0.7,~1.8T,多模态 长上下文),]forname,x,y,params,featureinversions:circleplt.Circle((x,y),0.07,colorlightblue,ecblack)ax.add_patch(circle)ax.text(x,y,name,hacenter,vacenter,fontsize7)ax.text(x,y-0.12,params,hacenter,fontsize7,colorblue)ax.text(x,y-0.2,feature,hacenter,fontsize6,colorgreen)# 时间线ax.plot([0.08,0.95],[0.7,0.7],k-,linewidth2)# 参数量增长ax2plt.axes([0.55,0.1,0.4,0.25])models[GPT-1,GPT-2,GPT-3,GPT-4]params_log[0.117,1.5,175,1800]ax2.bar(models,params_log,color[lightblue,lightblue,lightcoral,lightcoral])ax2.set_ylabel(参数量 (B))ax2.set_title(参数量增长)ax2.set_yscale(log)forbar,pinzip(ax2.bars,params_log):ax2.text(bar.get_x()bar.get_width()/2,bar.get_height()5,f{p}B,hacenter,vabottom,fontsize8)plt.suptitle(GPT系列演进,fontsize14)plt.tight_layout()plt.show()print(\n GPT系列对比:)print( GPT-1: 预训练微调范式)print( GPT-2: Zero-shot学习能力)print( GPT-3: In-context learning)print( GPT-3.5: 指令微调 RLHF (ChatGPT))print( GPT-4: 多模态 更长上下文)gpt_evolution()2.2 ChatGPT技术拆解defchatgpt_architecture():ChatGPT技术拆解print(\n*60)print(ChatGPT技术架构)print(*60)fig,axplt.subplots(figsize(12,8))ax.axis(off)# 三阶段stages[(Stage 1\n监督微调\n(SFT),0.15,0.7,lightblue),(Stage 2\n奖励模型\n(RM),0.5,0.7,lightgreen),(Stage 3\n强化学习\n(PPO),0.85,0.7,lightcoral),]forname,x,y,colorinstages:boxFancyBboxPatch((x-0.1,y-0.08),0.2,0.16,boxstyleround,pad0.02,facecolorcolor,ecblack)ax.add_patch(box)ax.text(x,y,name,hacenter,vacenter,fontsize8)# 箭头ax.annotate(,xy(0.4,0.74),xytext(0.25,0.74),arrowpropsdict(arrowstyle-,lw2))ax.annotate(,xy(0.75,0.74),xytext(0.6,0.74),arrowpropsdict(arrowstyle-,lw2))# 说明descriptions[(收集人工标注的\n对话数据,0.15,0.5),(训练模型比较\n人类偏好,0.5,0.5),(PPO优化\n奖励模型,0.85,0.5),]fordesc,x,yindescriptions:ax.text(x,y,desc,hacenter,vacenter,fontsize7,colorgray)ax.set_xlim(0,1)ax.set_ylim(0,1)ax.set_title(ChatGPT三阶段训练,fontsize14)plt.tight_layout()plt.show()chatgpt_architecture()三、开源大模型3.1 LLaMA系列defllama_series():LLaMA系列print(\n*60)print(LLaMA系列开源大模型里程碑)print(*60)fig,axesplt.subplots(1,2,figsize(14,6))# LLaMA版本对比ax1axes[0]models[LLaMA 1,LLaMA 2,LLaMA 3]sizes[65,70,400]# 最大版本参数量features[开源,商业可用,更强性能]xnp.arange(len(models))width0.6barsax1.bar(x,sizes,width,color[lightblue,lightgreen,lightcoral])ax1.set_xticks(x)ax1.set_xticklabels(models)ax1.set_ylabel(最大参数量 (B))ax1.set_title(LLaMA系列演进)forbar,size,featinzip(bars,sizes,features):ax1.text(bar.get_x()bar.get_width()/2,bar.get_height()10,f{size}B,hacenter,vabottom,fontsize9)ax1.text(bar.get_x()bar.get_width()/2,bar.get_height()-20,feat,hacenter,vabottom,fontsize8,colorwhite)# LLaMA生态ax2axes[1]ax2.axis(off)ax2.set_title(LLaMA生态,fontsize11)ecosystem LLaMA生态: ┌─────────────────────────────────────────────────────────┐ │ LLaMA (基础模型) │ └─────────────────────────────────────────────────────────┘ │ ┌─────────────────┼─────────────────┐ ▼ ▼ ▼ Alpaca Vicuna WizardLM (指令微调) (对话优化) (复杂推理) │ │ │ └─────────────────┼─────────────────┘ ▼ Guanaco, Orca, ... (进一步优化) ax2.text(0.05,0.95,ecosystem,transformax2.transAxes,fontsize9,verticalalignmenttop,fontfamilymonospace)plt.suptitle(LLaMA系列与生态,fontsize14)plt.tight_layout()plt.show()print(\n LLaMA系列对比:)print( LLaMA 1: 首次开源高质量大模型)print( LLaMA 2: 商业可用上下文4K)print( LLaMA 3: 上下文8K-128K更强性能)llama_series()3.2 其他开源模型defother_open_models():其他开源模型print(\n*60)print(其他开源大模型)print(*60)fig,axplt.subplots(figsize(12,8))ax.axis(off)models[(Mistral,2023,7B/8x7B,滑动窗口注意力, MoE,lightblue),(Qwen,2023,1.8B-72B,多语言, 工具调用,lightgreen),(DeepSeek,2023,7B-67B,MoE, 长上下文,lightcoral),(Yi,2023,6B-34B,双语, 200K上下文,lightyellow),(Gemma,2024,2B-7B,Google开源, 轻量,lightpink),]y_pos0.8forname,year,size,features,colorinmodels:boxFancyBboxPatch((0.05,y_pos-0.05),0.9,0.09,boxstyleround,pad0.02,facecolorcolor,ecblack)ax.add_patch(box)ax.text(0.1,y_pos,f{name}({year}),fontsize9,fontweightbold)ax.text(0.35,y_pos,size,fontsize8)ax.text(0.55,y_pos,features,fontsize8)y_pos-0.11ax.set_xlim(0,1)ax.set_ylim(0,1)ax.set_title(主流开源大模型对比,fontsize14)plt.tight_layout()plt.show()other_open_models()四、闭源大模型4.1 Claude与Geminidefclosed_source_models():闭源大模型print(\n*60)闭源大模型Claude、Geminiprint(*60)fig,axesplt.subplots(1,2,figsize(14,6))# Claudeax1axes[0]ax1.axis(off)ax1.set_title(Claude (Anthropic),fontsize11)claude_info Claude版本: • Claude 1: 首个版本 • Claude 2: 100K上下文 • Claude 3: - Haiku: 最快 - Sonnet: 平衡 - Opus: 最强 核心特点: • Constitutional AI • 长上下文 (200K) • 注重安全性 ax1.text(0.05,0.95,claude_info,transformax1.transAxes,fontsize9,verticalalignmenttop,fontfamilymonospace)# Geminiax2axes[1]ax2.axis(off)ax2.set_title(Gemini (Google),fontsize11)gemini_info Gemini版本: • Gemini Nano: 移动端 • Gemini Pro: 通用 • Gemini Ultra: 最强 核心特点: • 原生多模态 • 深度集成Google生态 • 长上下文 (1M) ax2.text(0.05,0.95,gemini_info,transformax2.transAxes,fontsize9,verticalalignmenttop,fontfamilymonospace)plt.suptitle(闭源大模型,fontsize14)plt.tight_layout()plt.show()closed_source_models()五、模型架构对比5.1 架构类型defarchitecture_comparison():模型架构对比print(\n*60)print(模型架构对比)print(*60)fig,axplt.subplots(figsize(12,8))ax.axis(off)comparison ╔════════════════════════════════════════════════════════════════════════════════╗ ║ 大模型架构对比 ║ ╠════════════════════════════════════════════════════════════════════════════════╣ ║ ║ ║ 架构类型 代表模型 特点 ║ ║ ─────────────────────────────────────────────────────────────────────────────║ ║ 纯解码器 GPT系列, LLaMA 自回归生成 ║ ║ (Decoder-only) Mistral, Qwen 应用最广泛 ║ ║ ║ ║ 编码器-解码器 T5, BART 序列到序列任务 ║ ║ (Encoder-Decoder) 翻译、摘要 ║ ║ ║ ║ 混合专家 (MoE) Mixtral, DeepSeek-MoE 稀疏激活参数多计算少 ║ ║ GPT-4 (传闻) 高效率 ║ ║ ║ ║ 状态空间模型 Mamba 线性复杂度 ║ ║ (SSM) 长序列高效 ║ ║ ║ ╚════════════════════════════════════════════════════════════════════════════════╝ ax.text(0.05,0.95,comparison,transformax.transAxes,fontsize10,verticalalignmenttop,fontfamilymonospace)plt.tight_layout()plt.show()architecture_comparison()六、总结模型系列代表模型特点开源GPTGPT-4, ChatGPT最强综合能力❌LLaMALLaMA 3, Vicuna开源生态✅MistralMixtral, Mistral 7B高效MoE✅QwenQwen 1.5/2多语言✅ClaudeClaude 3安全对齐❌GeminiGemini Ultra多模态❌核心要点模型规模持续增长百亿→千亿→万亿开源模型逼近闭源性能MoE架构成为趋势多模态是未来方向选择建议研究实验 → LLaMA 3 / Mistral中文场景 → Qwen / Yi生产部署 → GPT-4 / Claude资源受限 → Gemma / Mistral 7B
返回列表