
内容源自 datawhale 开源学习材料。如有侵权或其他问题欢迎留言联系更正或删除。目录1.1 什么是语言模型1.2 大语言模型的历史回顾1.3 大语言模型的能力及风险1.1 什么是语言模型(1) 语言模型是针对词汇序列 X1:L的概率分布 p更为超越的视角需深刻理解语言模型只是对词元序列的分布。这些词元可以表示自然语言、编程语言或音频或视觉词典中的元素。语言模型也属于更一般的基础模型类别这些模型与语言模型具有许多相似的属性。(2) 直观上一个好的语言模型应具有语言能力及世界知识(3) 自回归语言模型 (Autoregressive language models)(4) LLM 中的 温度参数 T 的 定义 及 作用 温度参数 T 用于调节语言模型生成过程中的随机性通过调整每一步条件概率分布 PT 的尖锐程度(5) 直接对概率取幂会破坏归一性需重新标准化 → 退火条件概率分布注意1.2 大语言模型的历史回顾(1) 信息理论、英语的熵、n-gram模型语言模型最初在信息理论背景下研究可用于估计英语的熵(2) N - gram 模型优势可扩展性劣势如果 n 太小模型将无法捕获长距离的依赖关系如果 n 太大统计上将无法得到概率的好估计即使在 “大” 语料库中几乎所有合理的长序列都出现0次(3) 神经网络模型1.3 大语言模型的能力及风险(1) 大语言模型的能力“大型语言模型”和其他常规语言模型相比在技术细节上相同但仅靠扩大参数规模即可获得模型能力上质的飞跃。语言模型LM具备条件生成的能力在给定提示prompt的情况下生成完整的文本Q. 填空 / 下一个词的预测 与 “上下文学习” 间的区别这两个例子体现了大模型不同的学习方式主要区别在于输入、学习方式和应用场景。填空的例子中输入是单词上下文学习例子中输入是句子。上下文学习可以通过提供示例让大模型学习示例提供我们需要的回答。特点有通过提供示例让模型模仿生成新内容适用于少样本学习即用少量例子引导模型执行任务而不需要重新训练适用于新闻生成、写作风格模仿、代码生成等任务。填空的例子体现的是大模型的另一种学习方式通过给定一部分文本单词让模型预测或补全缺失的信息。特点是需要模型基于已有信息直接预测缺失部分假设答案是唯一确定的因此通常用 T0确定性最大。(2) 大语言模型的风险