尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

神经网络是如何实现语义向量化的

神经网络是如何实现语义向量化的 这是一个很有意思的问题它触及了现代人工智能最核心的秘密。简单来说神经网络之所以能让文本实现“语义向量化”是因为它像一张庞大的“语义地图绘制网”通过在海量文本中进行“猜词游戏”学会了把每个词的“意思”压缩成一个多维坐标。而将这套理论变成可落地的强大技术其关键框架和思想主要归功于Google 团队的研究员 Tomas Mikolov 及其同事。下面我们来深入拆解一下这个“魔法”背后的原理和创造者。一、 神经网络是如何实现语义向量化的—— 从“One-Hot”到“语义地图”要让计算机理解语义关键在于改变信息的表示方式。1. 旧方法的困境One-Hot 编码在神经网络普及前计算机处理词汇的典型方法是独热编码 (One-Hot Encoding)。想象一个包含10万个词的词典每个词都被表示成一个10万维的向量其中只有一个是1其他全是0。- “苹果” [1, 0, 0, …]- “香蕉” [0, 1, 0, …]这种方式有两个致命缺陷-维度灾难向量极其稀疏计算效率低。-语义鸿沟任何两个词都是正交无关的无法表达“苹果”和“香蕉”都是水果这种语义上的相似性。2. 神经网络的核心思想压缩与猜词神经网络要做的就是把上面那个10万维的、毫无意义的稀疏向量压缩成一个几百维的、稠密的、蕴含语义的向量也就是Embedding。它靠的是一个核心假设分布语义学 (Distributional Semantics)即一个词的含义是由它的上下文决定的。简单说就是“看它和谁一起玩就知道它是什么样的人。”3. 具体如何实现—— Word2Vec 的“猜词游戏”Google 的 Tomas Mikolov 团队在2013年提出的Word2Vec模型是让这个思想家喻户晓的关键一步。它设计了两种极为巧妙的“猜词游戏”来训练神经网络从而得到词向量-模式一完形填空 (CBOW)给模型看一个词的上下文让它猜中间这个词是什么。例如输入“爱”、“自然”、“语言”让模型输出“处理”。为了能猜对模型必须学习到这些词之间的语义关联。-模式二词网扩散 (Skip-gram)给模型一个中心词让它猜它周围可能出现哪些词。例如输入“北京”让它输出“中国”、“首都”、“繁华”等。这个任务对不常见的词更友好。训练的成果经过在数十亿甚至百亿词汇上的训练这个简单的神经网络内部的参数就变成了一张巨大的“语义地图”。每个词都在这个几百维的空间里拥有了一个独一无二的“坐标”。语义相近的词它们的坐标会聚在一起如“猫”和“狗”而词与词之间的关系甚至可以通过向量的加减法来体现比如经典的“国王” - “男人” “女人” ≈ “女王”这就完美地证明了向量不仅包含了词义还编码了“性别”这类抽象关系。二、 这个领域的主要贡献者是谁语义向量化是一个跨越几十年的集体智慧结晶但有几个名字和机构在关键节点上做出了里程碑式的贡献。- 核心贡献者Tomas Mikolov 与 Google 团队 (2013)他们是真正将词向量技术带入主流视野的关键人物。2013年在 Google 工作的 Tomas Mikolov 与同事发表了 Word2Vec 的两篇奠基性论文。他们提出的 CBOW 和 Skip-gram 模型以及开源的实现让高效、高质量地训练词向量成为可能直接引爆了后续整个 Embedding 技术的研究和应用热潮。- 思想奠基人Yoshua Bengio 等 (2003)在深度学习浪潮之前Bengio 团队在2003年发表了《A Neural Probabilistic Language Model》开创性地提出用神经网络来学习词的分布式表示即Embedding为后人的研究奠定了理论基础。- 理论源头Zellig Harris (1950年代)任何关于词向量的讨论最终都会追溯到语言学家 Zellig Harris 在20世纪50年代提出的分布语义学理论。这个“一个词由它的上下文决定”的洞察是整个 Embedding 技术最底层的哲学根基。- 其他重要推动者-斯坦福大学团队 (GloVe)2014年他们提出的 GloVe 模型通过结合全局统计信息提供了另一种训练高质量词向量的有效方法。-Facebook 团队 (fastText)2015年他们提出的 fastText 模型通过考虑单词的内部构造子词信息解决了生僻词表示的问题。-Google 团队 (BERT, 2018)这又是一次飞跃。BERT 模型不再给每个词一个固定的向量而是能根据上下文动态生成向量彻底解决了“苹果”水果和“苹果”公司这种一词多义的问题开启了上下文嵌入 (Contextual Embedding)的新时代。总的来说神经网络通过“猜词游戏”将文本转化为蕴含语义的数学向量这一构想由 Bengio 等人奠基并由 Mikolov 和 Google 团队在2013年通过 Word2Vec 将其变为影响深远的主流技术。自此该领域迎来了井喷式的发展。我们目前在 RAG 系统中常用的 Embedding 模型例如 BGE、OpenAI 的text-embedding-ada-002等都是在此技术路线上不断演进、优化后的产物。
返回列表