
大语言模型的发展历程是一段非常精彩的演进史。我们可以把它比作一部波澜壮阔的《生命起源与进化》纪录片——从最原始的单细胞生物开始经过几次关键的进化大爆炸最终演化出今天像GPT-4这样复杂的智慧生命。根据技术范式的根本性转变这段历史大致可以划分为以下四个关键阶段。萌芽与奠基期时间20世纪90年代 - 2017年核心范式统计语言模型技术代表N-grams模型、最大熵模型。核心突破确立了语言模型的核心思想——根据上文预测下文。它将语言视为概率问题为后续所有工作奠定了数学基础。为什么是革命性在此之前机器处理语言主要靠人写的语法规则规则主义死板且无法覆盖所有情况。统计语言模型的理念转变是让机器从海量语料中自己学习规律经验主义。虽然当时模型还很笨拙比如我们聊过的N-grams视野狭窄但开启了数据驱动的新方向。神经网络的初步探索期时间2013年 - 2017年核心范式神经网络语言模型技术代表Word2Vec、RNN、LSTM。核心突破引入了词向量Embedding和循环思想。Word2Vec让词语从单纯的符号变成了富含语义的向量这是语言可计算的关键一步。RNN/LSTM引入了记忆机制理论上可以处理任意长度的序列比N-grams的短视强得多。为什么是革命性这是语言模型从统计走向智能的转折点。模型开始理解词语之间的语义关系比如国王 - 男人 女人 女王这是统计方法做不到的。但你之前也了解过它受限于顺序处理和长距离遗忘。Transformer与预训练的爆发期时间2017年 - 2020年核心范式预训练语言模型核心事件2017年谷歌发表论文《Attention Is All You Need》提出Transformer架构。技术代表BERT双向、GPT-1/2自回归、T5。核心突破架构革命Transformer通过自注意力机制彻底解决了RNN的顺序处理和长距离依赖问题实现了高效的并行计算和真正的全局视野。范式革命提出了预训练 微调的新范式。先在海量无标签数据上训练一个通用的基座模型然后针对具体任务如情感分析稍作微调即可。为什么是革命性这就像从手工作坊进入了工业化大生产。一个预训练模型可以胜任几乎所有NLP任务模型规模和能力开始呈现爆发式增长。我们现代意义上的大语言模型就是从这一时期开始萌芽的。scaling law 与通用人工智能的涌现期时间2020年 - 至今核心范式大语言模型核心事件2020年OpenAI发布GPT-3参数量达到1750亿。技术代表GPT-3/4、Claude系列、LLaMA系列、文心一言、通义千问。核心突破规模法则OpenAI发现模型的性能与模型大小、数据量、算力三者之间存在明确的幂律关系Scaling Law。只要把这三点同步做大模型能力就会持续提升没有天花板。能力涌现当模型规模突破某个临界点后会突然展现出小模型不具备的涌现能力比如上下文学习给几个例子它就懂、思维链能自己一步一步推理、代码编写等。对齐革命为了让这些强大的模型听话、有用、无害人类反馈强化学习等技术被引入这就是对齐。为什么是革命性模型不再仅仅是语言工具而是展现出了成为通用问题解决者的潜力。能力从理解语言跃迁到了理解和解决复杂任务。最后小结阶段模型能力核心驱动力统计模型机械的词语搭配语料库 频次统计神经网络理解语义相似性词向量 短期记忆预训练模型通用的语言理解Transformer 自监督学习大语言模型通用问题解决规模法则 人类对齐大语言模型的发展史本质上就是一部人类不断突破模型理解和记忆的物理限制并最终让机器展现出通用智能萌芽的历史。从N-grams的局部视野到RNN的有限记忆再到Transformer的全局视野最后到GPT的涌现能力每一步都踩在前人的肩膀上。