尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

LLM的发展趋势

LLM的发展趋势 文章目录1. 第一阶段从语言模型到 GPT2018-2020关键词**规模化Scaling**2. 第二阶段ChatGPT 让 LLM 从实验室走向大众2022-20231指令微调Instruction Tuning2人类反馈强化学习RLHF3. 第三阶段从文字模型到多模态模型2023-2025Text → Multimodal4. 第四阶段从“生成”到“推理”2024以后Reasoning Models推理模型5. 第五阶段Agent智能体时代2025以后6. 第六阶段小模型和专用模型崛起巨型模型小型模型7. 第七阶段个人化 AI8. 最终方向AGI通用人工智能总结LLM 的路线图1. Scaling Laws 与基础模型Foundation Models1模型规模规律Scaling Laws2. 预训练技术Pre-training1数据工程Data Engineering2新的模型架构长上下文模型Transformer 替代架构3. 后训练Post-training1Instruction Tuning2RLHF / RLAIF3Preference Optimization4. 推理能力Reasoning1Chain-of-Thought思维链2Test-Time Compute3Reasoning Model5. Agent 与自主系统AI Agents1Planning规划2Tool Use工具调用3Memory长期记忆6. 多模态大模型Multimodal LLMVision-Language ModelVLMVideo UnderstandingEmbodied AI具身智能7. RAGRetrieval-Augmented Generation8. LLM 安全与可靠性Safety Alignment1Hallucination幻觉2Alignment对齐3Interpretability可解释性9. 高效训练与部署Efficiency模型压缩低成本推理10. AI for Science科学智能目前研究热度大致排序2025前后如果从“未来 5 年最可能突破”的角度看1. 为什么需要 LoRAFull Fine-tuning全参数微调2. LoRA 的核心思想3. 为什么叫 Low-Rank4. LoRA 在 LLM 发展路线中的位置5. LoRA 和 RAG 的区别LoRARAG6. LoRA 为什么在近几年非常重要7. LoRA 的进一步发展QLoRAAdaLoRADoRA总结一句话1. QLoRALoRA 量化目前最成熟的改进2. DoRA改进 LoRA 的表达能力3. AdaLoRA动态分配参数4. LoHa / LoKr更强的低秩表达5. VeRA极端参数压缩方向6. Prompt Tuning / Prefix Tuning7. Adapter Tuning8. ReFT不改参数改“神经表示”9. Mixture-of-Adapters多个 LoRA 组合10. 最新趋势从“微调参数”到“学习能力模块”Skill AdapterAgent AdapterContinual Learning Adapter总体技术路线图如果从研究价值排序2025左右从 GPTGenerative Pre-trained Transformer开始LLMLarge Language Model大语言模型的发展大致经历了“规模化 → 对齐 → 多模态 → 推理 → 智能体 → 个性化/行业化”这几个阶段。核心趋势不是简单地“模型越来越大”而是从“会聊天”走向“能理解、能推理、能行动”。Transformer 架构在 2017 年提出后成为现代 LLM 的基础随后 GPT 系列通过扩大数据、参数和计算资源推动能力跃迁。(维基百科)1. 第一阶段从语言模型到 GPT2018-2020关键词规模化Scaling代表GPT-12018GPT-22019GPT-32020变化以前的 NLP一个模型解决一个任务翻译、分类、问答GPT 思路先训练一个通用语言模型再通过提示prompt完成各种任务。核心突破大规模预训练Transformer 架构海量互联网文本参数规模扩大GPT-3 证明了一件重要事情当模型足够大时会出现“涌现能力”emergent abilities例如简单推理、代码生成、文本总结。(arXiv)这个阶段的哲学更多参数 更多数据 更多算力 更强能力2. 第二阶段ChatGPT 让 LLM 从实验室走向大众2022-2023代表ChatGPTGPT-3.5GPT-4核心变化LLM 不再只是“预测下一个词”而是变成人类可以自然交流的助手。关键技术1指令微调Instruction Tuning让模型学会按要求回答遵循格式扮演角色2人类反馈强化学习RLHF让模型更符合人类偏好例如普通 GPT生成答案ChatGPT生成更有帮助、更安全、更符合交流习惯的答案这些技术成为 GPT 类系统快速普及的重要原因。(arXiv)3. 第三阶段从文字模型到多模态模型2023-2025趋势Text → Multimodal未来模型不只是读文字还能理解图片声音视频代码传感器数据例如以前用户描述这张图片模型只能分析文字未来用户看我的工厂视频告诉我设备哪里异常模型分析视觉 时间变化 工业知识代表方向GPT-4 系列多模态能力GeminiClaude 多模态模型多模态被认为是走向更通用智能的重要方向。(维基百科)4. 第四阶段从“生成”到“推理”2024以后过去LLM 更像一个知识丰富的聊天机器人问题容易幻觉数学推理弱长任务容易失败新的方向Reasoning Models推理模型特点模型会分析问题分解步骤检查答案再输出结果类似普通模型问题 → 答案推理模型问题 ↓ 分析 ↓ 规划 ↓ 验证 ↓ 答案未来竞争重点可能从谁参数最大转向谁推理效率最高5. 第五阶段Agent智能体时代2025以后这是目前最重要趋势之一。LLM 从“回答问题”变成“完成任务”。例如以前用户帮我做市场分析AI给你一份文字报告未来 Agent搜索资料阅读文件分析数据写报告做 PPT发邮件跟踪结果结构LLM 大脑 | | 工具调用 | ---------------- 搜索 数据库 代码执行 浏览器 企业系统LLM 会成为各种软件的智能控制层。6. 第六阶段小模型和专用模型崛起过去趋势越大越好现在出现两个方向巨型模型用于通用智能科研复杂推理例如 GPT、Gemini、Claude 等。小型模型用于手机汽车企业内部边缘设备优势成本低私密性强延迟低例如一个医院可能不用调用云端大模型而是在内部部署医疗模型。未来可能是超级大模型 行业模型 个人模型7. 第七阶段个人化 AI未来每个人可能拥有自己的 AI 助手。它了解你的工作方式写作风格学习习惯项目背景长期目标例如你的 AI“根据你过去三年的投资研究习惯我整理了这份分析。”这会推动 LLM 从公共工具变成个人认知外脑。8. 最终方向AGI通用人工智能很多研究者认为 LLM 是通往 AGI 的重要路径但目前是否已经达到 AGI 仍存在广泛讨论。未来可能需要解决问题当前状态语言理解非常强知识记忆强但会错逻辑推理快速提升长期规划仍有限现实世界交互不足自主学习早期阶段总结LLM 的路线图可以浓缩成2018 GPT-1 ↓ 更大模型 2020 GPT-3 ↓ 规模化智能 2022 ChatGPT ↓ 人机交互革命 2023 GPT-4 ↓ 多模态 2024-2025 推理模型 ↓ 更强思考能力 2025 AI Agent ↓ 执行任务 未来 个人AI 行业AI 世界模型 ↓ 通用智能一句话总结LLM 的发展方向正在从“预测文字的机器”变成“理解世界、进行推理、调用工具并替人完成复杂工作的智能系统”。未来 5-10 年最大的变化可能不是“AI 会不会聊天”而是大量知识工作会从人操作软件变成人管理 AI Agent 完成工作。从研究领域看近几年 LLM 的研究方向已经从早期的“把模型做大”逐渐转向“让模型更可靠、更智能、更高效、更接近通用智能”。如果按照学术界和工业界的研究热点划分大致可以分为以下方向1. Scaling Laws 与基础模型Foundation Models核心问题模型规模如何影响智能这是 GPT-3 时代开启的研究方向。研究内容1模型规模规律Scaling Laws研究参数量数据量计算量性能提升之间的关系典型问题1000 亿参数模型是否一定比 100 亿参数模型好研究发现不是简单增加参数而是需要合理的数据规模更高质量数据更优训练策略近年来出现Chinchilla scaling lawCompute-optimal training即与其盲目扩大模型不如让模型、数据和计算达到最佳比例。2. 预训练技术Pre-training这是 LLM 的基础研究。研究方向1数据工程Data Engineering越来越重要。包括数据过滤去重数据质量评估合成数据生成过去有多少网页就训练多少现在数据质量决定模型上限研究问题什么样的数据产生推理能力如何自动构造高价值训练集2新的模型架构Transformer 仍然主流但研究者在探索长上下文模型目标从几十页文本到百万 token。研究Long Context TransformerAttention 优化Memory机制Transformer 替代架构例如MambaState Space ModelRWKVHyena目标降低 Transformer 的计算复杂度。3. 后训练Post-training这是近几年最热门方向之一。因为研究发现基础模型能力 ≠ 用户可用能力需要进一步训练。主要包括1Instruction Tuning让模型学会遵循指令输出格式完成任务研究问题如何自动生成高质量指令数据2RLHF / RLAIF让模型符合人类偏好。研究人类反馈强化学习AI 反馈强化学习核心问题如何定义“好的回答”3Preference Optimization近年来非常热门。例如DPODirect Preference OptimizationIPOKTO目标不用复杂 RL也能优化模型行为。4. 推理能力Reasoning这是 2024 年以后最核心方向之一。研究问题为什么 LLM 会语言却不会稳定推理方向1Chain-of-Thought思维链让模型一步一步解决问题。例如数学题问题 ↓ 步骤1 ↓ 步骤2 ↓ 答案2Test-Time Compute一个重要趋势过去训练时增加计算。现在推理时增加计算。例如模型回答前多次尝试自我检查搜索路径类似“考试时多花时间思考”。3Reasoning Model研究如何训练模型进行深度推理如何评价推理能力如何避免伪推理涉及数学编程科学推理复杂规划5. Agent 与自主系统AI Agents目前非常活跃。核心问题如何让 LLM 从回答者变成执行者研究方向1Planning规划例如目标“帮我安排一次商务旅行”模型需要理解目标 ↓ 拆任务 ↓ 选择工具 ↓ 执行 ↓ 检查结果研究Task decompositionHierarchical planning2Tool Use工具调用让模型调用搜索数据库PythonAPI企业软件研究Tool learningFunction calling3Memory长期记忆当前 LLM短期记忆强长期记忆弱。研究外部记忆数据库用户建模Episodic memory目标打造“认识你的 AI”。6. 多模态大模型Multimodal LLM从文本走向Text ↓ Image ↓ Audio ↓ Video ↓ Robot perception研究方向Vision-Language ModelVLM研究如何让模型理解图片视频空间关系问题为什么模型看到了但理解不了Video Understanding热门方向视频事件理解长视频记忆视频推理例如“看一个小时会议录像总结决策过程。”Embodied AI具身智能结合LLM Robot研究机器人语言控制世界模型现实环境学习7. RAGRetrieval-Augmented Generation这是工业界非常重要的方向。核心让模型连接外部知识。结构用户问题 ↓ 检索数据库 ↓ 相关资料 ↓ LLM生成答案研究问题如何检索最相关信息如何避免错误引用如何处理动态知识应用企业知识库医疗法律金融8. LLM 安全与可靠性Safety Alignment非常大的研究领域。包括1Hallucination幻觉问题模型会生成不存在的信息。研究事实验证引用机制自检能力2Alignment对齐研究如何让模型遵守人类意图避免危险行为理解价值约束3Interpretability可解释性核心问题我们知道模型输出什么但不知道为什么。研究Mechanistic InterpretabilityNeural Circuit Analysis目标理解 Transformer 内部机制。9. 高效训练与部署Efficiency工业界非常关注。研究模型压缩包括Quantization量化Pruning剪枝Distillation蒸馏目标1000亿参数模型→ 手机可运行。低成本推理研究KV Cache优化Flash AttentionSpeculative Decoding10. AI for Science科学智能近几年快速增长。方向LLM 辅助生物化学材料数学物理例如自动阅读论文生成实验方案辅助证明数学定理目前研究热度大致排序2025前后如果看论文数量和工业投入方向热度Reasoning / 推理模型★★★★★AI Agent★★★★★Multimodal LLM★★★★★Post-training★★★★★RAG★★★★Efficient LLM★★★★Interpretability★★★★Robotics / Embodied AI★★★★新架构Transformer替代★★★Scaling Laws★★★如果从“未来 5 年最可能突破”的角度看学术界目前最关注的几个问题LLM 如何获得可靠推理能力如何让 AI Agent 长时间自主完成复杂任务如何让模型理解真实世界多模态 世界模型如何降低训练和运行成本如何理解和控制大模型内部机制一句话概括LLM 研究正在从“训练一个更大的语言模型”转向“构建一个能够感知世界、持续学习、推理规划并执行任务的智能系统”。如果从计算机科学研究路线来看未来最核心的交叉领域会集中在机器学习 认知科学 强化学习 NLP 机器人 系统工程的交汇处。LoRALow-Rank Adaptation低秩适配属于上面提到的“模型后训练Post-training/ 参数高效微调Parameter-Efficient Fine-Tuning, PEFT”这一类技术。它解决的问题是如何让一个已经训练好的大语言模型适应新的任务而不用重新训练整个模型。1. 为什么需要 LoRA以 GPT 类模型为例一个大模型可能有70 亿参数7B700 亿参数70B甚至更多如果想让它学习一个新领域例如医疗问答法律文本企业内部知识特定写作风格传统方法Full Fine-tuning全参数微调把所有参数重新训练原模型 W1000亿参数 ↓ 训练 新模型 W1000亿参数问题GPU需求巨大成本高容易破坏原模型能力灾难性遗忘每个任务保存一个完整模型例如公司有医疗助手财务助手客服助手传统方式需要保存GPT-70B 医疗版 700亿参数 GPT-70B 财务版 700亿参数 GPT-70B 客服版 700亿参数成本非常高。2. LoRA 的核心思想LoRA 的想法不改变原来的大模型只增加一个很小的“插件”。假设原模型某个神经网络层[y Wx]其中W 是模型参数矩阵x 是输入Full fine-tuning直接修改 W[W \rightarrow W’]LoRA保持 W 不变[W]增加一个小变化[W’ W \Delta W]其中[\Delta W BA]也就是两个低维矩阵原权重 W | | 输入 x ---- | ↓ 输出 y LoRA: x | ↓ A矩阵 | B矩阵 | ↓ 小的调整 ΔW训练时只训练A 和 B而不是 W。3. 为什么叫 Low-Rank因为大型模型里的权重矩阵通常很大。例如W: 10000 × 10000 参数量 100,000,000如果直接训练1亿参数。LoRA 假设真正需要改变的信息其实很少。所以不用训练10000 × 10000而训练10000 × r r × 10000其中r 很小例如481664如果 r8参数10000×8 8×10000 160,000从1亿减少到16万。4. LoRA 在 LLM 发展路线中的位置对应之前的路线基础模型训练 | | ↓ Pre-training (GPT训练) | | ↓ Post-training | ---------------- | ↓ Instruction tuning | ↓ Preference optimization | ↓ PEFT | --- LoRA | --- Adapter | --- Prefix tuning所以LoRA 是让大模型适配新任务的一种后训练技术。5. LoRA 和 RAG 的区别很多人容易混淆。LoRA改变模型。例如让模型学会医疗专家说话方式训练模型参数 ↓ 改变 ↓ 医疗模型适合风格改变专业能力增强特定任务RAG不改变模型。只是提供资料用户问题 ↓ 搜索数据库 ↓ 找到资料 ↓ 给LLM回答适合最新知识企业文档内部资料简单比较LoRARAG是否训练模型是否改变参数少量不改变成本中等低知识更新慢快适合领域化强强适合实时信息弱强实际系统经常LoRA RAG 一起用。例如一个法律 AILoRA学法律语言风格学法律推理模式RAG查询最新法规查询案例库6. LoRA 为什么在近几年非常重要因为它改变了大模型应用模式。以前只有大公司能训练模型。现在个人或小团队可以拿一个开源模型例如LlamaMistralQwen然后用少量 GPU训练一个金融助手编程助手企业客服模型7. LoRA 的进一步发展LoRA 之后出现很多改进QLoRALoRA Quantization量化特点让 65B 级模型也能在有限 GPU 上微调。AdaLoRA动态调整哪些参数需要更多训练。DoRA改进 LoRA 的权重更新方式。总结一句话LoRA 是一种“轻量级改造大模型”的方法冻结原来的 GPT 类模型只训练少量低秩参数让模型快速适应新的领域或任务。在 LLM 技术路线中它属于Post-training → Parameter Efficient Fine-TuningPEFT是过去几年推动开源大模型生态快速发展的关键技术之一。这是一个很好的问题。LoRA 属于Parameter-Efficient Fine-TuningPEFT参数高效微调方向。近几年这个方向非常活跃因为大家发现未来不会给每个任务重新训练一个千亿参数模型而是希望用很小的代价“改造”一个基础模型。LoRA 之后的研究大致沿着几个方向发展更高性能、更低成本、更灵活的适配方式。下面按照研究趋势介绍。1. QLoRALoRA 量化目前最成熟的改进论文QLoRA: Efficient Finetuning of Quantized LLMs (2023)核心思想LoRA 解决少训练参数QLoRA 进一步解决连基础模型存储都太贵传统 LoRA冻结70B模型权重训练LoRA adapter但是70B 模型本身仍然需要 GPU 显存。QLoRA先把基础模型压缩FP16模型 ↓ 4-bit量化模型然后在量化模型上训练 LoRA。结构4-bit LLM | | 输入 ------ Transformer | | LoRA Adapter | ↓ 输出效果一个大型模型可以在更少 GPU 上微调。所以现在很多开源模型微调流程Llama / Qwen / Mistral ↓ 4-bit量化 ↓ QLoRA训练已经成为工业标准之一。(arXiv)2. DoRA改进 LoRA 的表达能力论文DoRA: Weight-Decomposed Low-Rank Adaptation (2024)LoRA 的问题它假设权重变化主要存在于低秩空间。但是一个权重矩阵变化实际上包含两个因素方向direction大小magnitudeLoRA直接学习[W\Delta W]DoRA拆开权重 方向(direction) × 大小(magnitude)类似人的学习不是重新学习全部知识而是调整思维方向调整强调程度优势在一些任务上接近 Full Fine-tuning 性能。3. AdaLoRA动态分配参数普通 LoRA所有层使用相同 rank。例如Layer 1 rank8 Layer 2 rank8 Layer 3 rank8 ...问题不同层重要性不同。AdaLoRA自动决定哪里需要更多参数。例如Attention层 rank32 FFN层 rank4类似把预算花在最重要的位置。研究方向自动寻找模型中最值得修改的位置。4. LoHa / LoKr更强的低秩表达LoRA矩阵[\Delta WBA]LoHa使用Hadamard product元素乘增加表达能力。LoKr使用Kronecker product克罗内克积目标用更少参数表示更复杂变化。简单理解LoRA小积木LoHa / LoKr更复杂的小积木组合主要用于Stable Diffusion大模型适配5. VeRA极端参数压缩方向VeRA (Vector-based Random Matrix Adaptation)思想LoRA每个任务保存两个矩阵A BVeRA使用共享随机矩阵 少量向量。结构LoRATask A: A矩阵 B矩阵 Task B: A矩阵 B矩阵VeRA共享随机矩阵 任务向量优势adapter 可以非常小。适合大量任务、多租户系统。6. Prompt Tuning / Prefix Tuning这是一条不同路线。LoRA修改模型参数。Prompt tuning不改模型。而是在输入前增加“虚拟 token”。例如原输入总结下面文章 xxxx变成[虚拟token1] [虚拟token2] [虚拟token3] 总结下面文章 xxxx模型参数完全冻结。优点非常省。缺点能力通常弱于 LoRA。7. Adapter Tuning比 LoRA 更早。思想在 Transformer 中插入小模块Transformer Layer Attention ↓ Adapter ↓ FFN训练Adapter。冻结原模型。LoRA 可以看作一种更数学化、更轻量的 Adapter。8. ReFT不改参数改“神经表示”这是一个比较新的研究方向。论文Representation Finetuning (ReFT, 2024)LoRA修改权重。ReFT修改隐藏状态representation。简单说LLM内部输入 ↓ 隐藏表示 ↓ 输出ReFT直接干预隐藏表示空间类似不改变大脑结构而改变思维状态。研究者认为有时候改变 representation 比改变 weight 更有效。(维基百科)9. Mixture-of-Adapters多个 LoRA 组合未来企业场景很重要。例如一个基础模型Qwen-72B多个 LoRA医疗LoRA 金融LoRA 法律LoRA 客服LoRA运行时动态组合用户问题 ↓ 选择adapter ↓ 回答类似给一个通用大脑加载不同技能包。10. 最新趋势从“微调参数”到“学习能力模块”目前研究方向正在变化以前怎样更少参数地改变模型现在怎样让模型获得新能力所以出现Skill Adapter学习编程能力推理能力工具使用能力Agent Adapter让模型学规划调用工具长任务执行Continual Learning Adapter让模型持续学习新知识。总体技术路线图可以这样看Full Fine-tuning | ↓ Parameter Efficient Fine Tuning | | ----------------------- | | | LoRA Adapter Prompt | | --------------------------- | | | | QLoRA DoRA AdaLoRA LoHa | | 低成本大模型定制 未来 Representation Tuning Agent Adapter Continual Learning如果从研究价值排序2025左右方向研究热度原因QLoRA★★★★★已经成为开源微调主流DoRA★★★★提升LoRA性能Adaptive LoRA★★★★自动优化参数Representation Fine-tuning (ReFT)★★★★探索新范式Agent Adapter★★★★★面向未来AI AgentContinual Learning★★★★★解决长期学习Prompt/Prefix tuning★★★成熟但性能有限一句话总结LoRA之后的研究核心不是简单“减少训练参数”而是探索如何用最小的改变让一个基础模型获得新的能力。未来方向会从“参数微调weight tuning”逐渐走向“能力模块化skill adaptation和持续学习continual adaptation”。如果从博士研究方向角度看目前最值得关注的是Agent PEFT、Reasoning能力注入、Continual Learning、Representation Fine-tuning这几个交叉方向。
返回列表