NLP-信息熵、条件熵、互信息的简介

发布时间:2026/7/28 13:57:09

NLP-信息熵、条件熵、互信息的简介 文章目录一、信息熵二、条件熵三、互信息一、信息熵1948年,香农在他的《通信的数学原理》中提出了信 息 熵 信息熵信息熵的概念解决了信息的度量问题如何理解信息的度量通俗的解释就是有多少信息量一条信息的信息量与其不确定性有着直接的关系比如某事情A经常发生那么它的信息量就相对小如果某件事B发生的概率极低那么它的信息量就相对大。信息熵的定义如下H ( X ) − ∑ x i n X P ( x ) ∗ l o g P ( x ) H(X)-\sum_{x \ in \ X}{P(x)*logP(x)}H(X)−xinX∑​P(x)∗logP(x)用一个例子来理解该公式假设你想知道隔壁班在本次考试中谁得了第一那么对应的信息熵为H ( X ) P ( A 第 一 ) ∗ l o g P ( A 第 一 ) P ( B 第 一 ) ∗ l o g P ( B 第 一 ) P ( C 第 一 ) ∗ l o g P ( C 第 一 ) . . . H(X)P(A第一)*logP(A第一)P(B第一)*logP(B第一)P(C第一)*logP(C第一)...H(X)P(A第一)∗logP(A第一)P(B第一)∗logP(B第一)P(C第一)∗logP(C第一)...二、条件熵为什么引入条件熵呢基于一、一条信息的信息量与其不确定性有着直接的关系也就是知道得越多随机事件的不确定性越小也就是信息量越小如果你想知道事件X的信息量而事件Y的不确定性对X有影响那么在知道Y的条件下X的信息熵为H ( X ∣ Y ) − ∑ x i n X , y i n Y P ( x , y ) ∗ l o g P ( x ∣ y ) H(X|Y)-\sum_{x \ in \ X,y \ in \ Y}{P(x,y)*logP(x|y)}H(X∣Y)−xinX,yinY∑​P(x,y)∗logP(x∣y)三、互信息简介基于二、假设了Y对X有影响也就是X和Y之间有相关性那么如何度量这种相关性呢在此引入互信息定义如下假设有两个随机事件X和Y那么他们的互信息如下I ( X ; Y ) ∑ x i n X , y i n Y P ( x , y ) ∗ l o g P ( x , y ) P ( x ) ∗ P ( y ) I(X;Y)\sum_{x \ in \ X,y \ in \ Y}{P(x,y)*log{\frac{P(x,y)}{P(x)*P(y)}}}I(X;Y)xinX,yinY∑​P(x,y)∗logP(x)∗P(y)P(x,y)​ H ( X ) − H ( X ∣ Y ) H(X)-H(X|Y)H(X)−H(X∣Y)可认为在了解Y的前提下对消除X的不确定性所提供的信息量应用-歧义消解原理假设词语X有两层含义a和b在不同语境下的意思不一致需要在不同的语境中理解为不同的含义但是由于都是X无法区分那么可以从大量的本文之中找出和a互信息比较大的n个词作为a的特征找出和b互信息比较大的n个词作为b的特征但出现一段文本的时候根据特征识别X的具体含义如下以苹果为例苹果包含水果和苹果公司两层含义1、从关于苹果公司的语料中学习a的特征原始语料语料1苹果 致力 于 科技 语料2美国人 支持 苹果 公司 语料3苹果 是一家 科技 公司去除停用词语料1苹果 致力 科技 语料2美国人 支持 苹果 公司 语料3苹果 科技 公司概率统计语料库中的长度为10,P ( 苹 果 ) 3 10 P(苹果)\frac{3}{10}P(苹果)103​P ( 致 力 ) 1 10 P ( 致 力 , 苹 果 ) 1 7 P(致力)\frac{1}{10}P(致力,苹果)\frac{1}{7}P(致力)101​P(致力,苹果)71​P ( 科 技 ) 2 10 P ( 科 技 , 苹 果 ) 2 7 P(科技)\frac{2}{10}P(科技,苹果)\frac{2}{7}P(科技)102​P(科技,苹果)72​P ( 美 国 人 ) 1 10 P ( 美 国 人 , 苹 果 ) 1 7 P(美国人)\frac{1}{10}P(美国人,苹果)\frac{1}{7}P(美国人)101​P(美国人,苹果)71​P ( 支 持 ) 1 10 P ( 支 持 , 苹 果 ) 1 7 P(支持)\frac{1}{10}P(支持,苹果)\frac{1}{7}P(支持)101​P(支持,苹果)71​P ( 公 司 ) 2 10 P ( 公 司 , 苹 果 ) 2 7 P(公司)\frac{2}{10}P(公司,苹果)\frac{2}{7}P(公司)102​P(公司,苹果)72​那么根据I ( X ; Y ) ∑ x i n X , y i n Y P ( x , y ) ∗ l o g P ( x , y ) P ( x ) ∗ P ( y ) I(X;Y)\sum_{x \ in \ X,y \ in \ Y}{P(x,y)*log{\frac{P(x,y)}{P(x)*P(y)}}}I(X;Y)∑xinX,yinY​P(x,y)∗logP(x)∗P(y)P(x,y)​得(这里词已是最小单位无需∑ \sum∑):I ( a ; 致 力 ) P ( 致 力 , 苹 果 ) ∗ l o g P ( 致 力 , 苹 果 ) P ( 苹 果 ) ∗ P ( 致 力 ) 1 7 ∗ l o g 1 7 3 ∗ 1 10 ∗ 10 0.2229 I(a;致力)P(致力,苹果)*log\frac{P(致力,苹果)}{P(苹果)*P(致力)}\frac{1}{7}*log \frac{\frac{1}{7}}{\frac{3*1}{10*10}}0.2229I(a;致力)P(致力,苹果)∗logP(苹果)∗P(致力)P(致力,苹果)​71​∗log10∗103∗1​71​​0.2229I ( a ; 科 技 ) 2 7 ∗ l o g 2 7 3 ∗ 2 10 ∗ 10 0.2478 I(a;科技)\frac{2}{7}*log \frac{\frac{2}{7}}{\frac{3*2}{10*10}}0.2478I(a;科技)72​∗log10∗103∗2​72​​0.2478I ( a ; 美 国 人 ) 1 7 ∗ l o g 1 7 3 ∗ 1 10 ∗ 10 0.2229 I(a;美国人)\frac{1}{7}*log \frac{\frac{1}{7}}{\frac{3*1}{10*10}}0.2229I(a;美国人)71​∗log10∗103∗1​71​​0.2229I ( a ; 支 持 ) 1 7 ∗ l o g 1 7 3 ∗ 1 10 ∗ 10 0.2229 I(a;支持)\frac{1}{7}*log \frac{\frac{1}{7}}{\frac{3*1}{10*10}}0.2229I(a;支持)71​∗log10∗103∗1​71​​0.2229I ( a ; 公 司 ) 2 7 ∗ l o g 2 7 3 ∗ 2 10 ∗ 10 0.2478 I(a;公司)\frac{2}{7}*log \frac{\frac{2}{7}}{\frac{3*2}{10*10}}0.2478I(a;公司)72​∗log10∗103∗2​72​​0.2478提取苹果表示苹果公司的特征a:本文提取互信息最大的两个特征科技、公司2、类推:按照以上过程提取苹果表示水果的特征b:假设提取的b的特征为水果、价格3、判别那么输入一个文本的时候判断该文本中哪一类的特征多即可判断意思参考吴军老师的《数学之美》

相关新闻