对指数族分布的注解

发布时间:2026/7/30 14:09:15

对指数族分布的注解 一、说明先了解一下这个名称——指数分布“家族”这表明我们并不是在谈论任何一个分布而是在谈论一组分布。事实上指数分布家族涵盖了包括高斯分布、泊松分布、伯努利分布、伽马分布等的广泛类别这些分布共享一些共同性质。我们学到的大多数分布都来自这个家族。有趣的是指数分布也属于这一类。那么如何判断某个特定分布是否属于这个家族呢二、指数族分布在我们进入这个阶段之前先考虑一个简单的高斯分布。我们知道大多数分布或模型都可以用其参数集来表示。例如神经网络模型用其参数来表示这些参数仅包含权重和偏差。大型语言模型LLM其实就是大型神经网络。他们同样以权重来表达。一个1万亿的Qwen-3-Max模型拥有1万亿个权重和偏差这些权重定义了该模型并包含了训练过程中学到的所有数据模式。这些权重在输入信号流经模型时进行转换输出随之生成。无论如何回到我们最喜欢的高斯它的参数集θ仅包含两个数字均值μ和方差σ²。如果我们知道这对组合就能自己生成高斯数据集。定一个高斯观测值数据集我们可以用机器学习来找出最能解释该数据集的 μσ²。然后我们可以通过生成数据来做生成式人工智能当然我们的生成式人工智能无法与大型语言模型竞争但其理念是相同的。好了现在让我们回到指数家庭的概念。与其像往常那样从MLE中求μ和σ²不如稍微修改高斯PDF方程如下该死原本的方程看起来更简单。除了展示我们的数学我们还有什么收获那么我们将参数集重新命名如下与其采用传统的μ和σ²组合不如使用上述θ1和θ2作为参数集。现在我们不再搜索最佳μ和σ²而是用MLE来寻找最佳θ1和θ2。一旦得到θ1和θ2我们可以轻松计算出μ和σ²这与正则方法得到的值相同。但为什么要做这些杂耍因为这样我们的底层分布不仅需要是高斯分布著名的钟形曲线还可以采用许多其他形式。 因此我们不必假设底层分布是钟形并计算μ和σ²而是用同样的努力求解上述格式这样可以容纳更多形状因此更灵活。我们重新定义了问题三、重新参数化模型我们之前在训练VAE时遇到过“重新参数化”这个术语在那里我们重新参数化了潜在分布高斯分布使采样变得可微并实现了本来较为困难的反向传播一般来说重新参数化是指用一组新的参数来表达分布或模型通常通过变换原始参数来简化数学。给定一个以参数集θ表示的分布px我们重新参数化使其表示为η其中η是θ的某个函数。以上述高斯算法为例我们从直观的原始参数集合θ均值/方差组合转变为一个不那么直观但数学上更方便的参数集η即μ/σ²和-1/2σ²的组合。通过这样做我们以更“自然”的方式表示分布对数学来说而不是对你。所以这被称为自然表征。你的教授可能会使用更正式的术语即规范表示。“规范”仅仅意味着自然。查找足够的统计数据或计算时刻等东西突然变得简单多了我们稍后会用通俗易懂的英语讨论这些术语。四、指数家族格式任何PDF可用以下格式编写的发行版均属于指数系列。我来自应用人工智能背景数学知识有限常常发现如果长时间盯着数学方程看它会开始稍微理解一点。我们只取左边p 是我们的 PDF即 P可移动性 D密度 F恩膏。x 是观测到的数据点。η 是“自然”参数集。所以左边基本上告诉我们观察到一个数据点x的概率密度其参数为自然η可以通过右侧的公式计算出来。现在让我们看看方程的右侧这对AI从业者来说似乎更致命。4.1 基础指标hx 是“基准测度” 是 x 似然中不由参数引起的分量。可以把它看作是分布的“底层骨架”还没考虑参数的影响。它可以控成只有1因此现在可以跳过讨论。详情见附录。4.2 对数归一化器aη 是“日志归一化器”或“日志分区”。它的简单任务是确保分发PDF集成到一个PDF中。你可能听说过“常态化常数”Z这个词在本系列博客中多次困扰我们。其实就是同一个人只是前面加了个“log”也就是说是logZ。你可以从以下角度理解我的意思好右边的两个术语其实挺简单的。稍后我们会重新审视aη因为它做了重要的事情。现在让我们谈谈最后一项——η 和 tx 的点积。我们知道什么是η。它是参数集。tx 是充分统计量。这意味着什么4.3 充分统计量我们知道数据x的任何函数都称为统计量。所以我们可以定义一个函数 fx 2*x它被称为统计量。平均值是一个统计量。统计学用于推断整个总体的信息而无需测量每一个数据点。tx 也是 x 的某个函数因此称为统计量。但什么是“足够”呢充分性描述了数据集中的关键要素。凡是不存在的都可以直接丢弃因为它是非必需的。tx 之所以称为充分统计量是因为它是数据 x 的一个函数捕捉了产生数据的底层分布未知参数的所有相关信息。换句话说这个tx包含了计算原始分布参数所需的所有关于数据样本的信息。也就是说观察到tx后我们也可以丢弃数据集因为我们已经提取了所有关键信息无需再保留这些包袱。我们有效地将庞大的数据集压缩成几个数字。简单来说我们可以把tx看作是一个提取x重要特征的函数。另外请注意上方新PDF中datax和parameterη组件的清晰分离。让我们用一个例子来理解这些内容注我希望到目前为止语言是简单的。如果你是统计学的新手我建议先读这篇入门文章。五、高斯PDF以指数格式重写首先让我们用指数格式重写高斯PDF格式让我们将上述高斯表示与指数族格式的定义进行比较并记下关键字符。注意新的参数集 η [ μ/σ² -1/2σ² ] 取代了旧的 θ [μ σ²] 参数集。注意η可以由θ推导反之亦然一般来说多个η值是可能的。自然参数空间是所有此类η值的集合对此我们得到有效的PDF。同一分布可以通过指数族格式以多种方式表示。我们可以选择自己喜欢的那个。上述aη用μ和 σ² 表示。我们还可以进一步代入η的值即η1和η2并用完全的 η 表示。注意函数 hx 不涉及 θ因此在对数似然中会显示为一个简单的常数。现在让我们来谈谈神秘的充分统计量。它是[x x²]。注意这只依赖于x。根据上述定义一个大型样本X可以用这个二维统计量来总结。哇但怎么做呢你看上面的指数格式方程是针对单个观测数据点x的。如果我们有一个完整的数据集X包含一百万个独立且完全D分配的数据点会发生什么节理密度仅为各个密度的乘积。由于指数的性质指数中的项会相加。充分统计量最终是x和x²的加法即我们的充分统计量最终为而不是[x x²]。好吧但这怎么总结了一百万个数据点通过数据样本和平方和的取值我们可以轻松计算出原始的θ即样本的均值和方差怎么计算“mean”很直接。方差是平方均值减去均值平方的平方。我们知道高斯图可以完全表达为两个参数——均值/方差对应。所以一旦有了tx我们就能得到均值/方差对方而百万个数据样本就可以直接丢弃了这就是为什么tx被称为充分统计量此外模型可以随着新数据的到来逐步更新。 冈德森的博客在这方面表达得清晰简洁。例如想想我们如何维持连续输入数据流的平均值。它可以逐步完成资源消耗非常少。六、深入探讨指数家族格式特别注意η与tx之间的有趣点积。这就是指数家庭模式的核心。hx 可以作为 1。对数归一化器只是一个归一化子确保概率加或积分到1并且在这种意义上不显著。方程的核心是η与tx之间的点积。它决定了自然参数和数据如何线性交互。向量η自然参数直接控制统计量的指数权重。实际上我们说的是 PDF 即密度与以下成正比请按回车或点击查看全尺寸图片也就是说它使用了足够属性的线性组合。这种线性组合由自然参数定义。例如在高斯分布的情况下我们就有一个 x 和 x² 的线性组合。这在几何上意味着什么可惜我没能完全理解。C.R. Rao在其博士导师Fisher的指导下引入了统计几何理论。天理俊一通过信息几何的研究丰富了该领域。可以想象一个统计流形——一个几何空间每个点代表不同的概率分布。各种概率分布族对应该流形的特定结构。在该领域定义概率分布之间的有意义距离在信号处理、定量金融等领域有广泛应用。事实上拉奥通过引入拉奥距离拉开了序幕。我们最喜欢的指数分布族很可能在这个统计流形中形成一个平坦空间。无论如何让我们回到上面的方程。方程中的exp函数确保概率密度为正。tx 是否保证永远足够费舍尔-奈曼分解定理指出如果似然可以以某种方式分解则tx是充分的。所以先从可能性联合PDF开始做些小调整我们就能轻松证明这一点。七、 指数族分布的优势现在让我们来看一下指数分布族所谓的便捷数学性质。这些希望是好的因为我们花了很多心思来定义和奠定这个家庭的基础。1 只要看看指数族格式我们就能仅凭检查获得足够的统计量。对于高斯分布我们知道它是均值/变量对应。或者它可能是泊松的速率参数或者根据情况二项式的成功概率参数。我们不假设数据来自高斯分布而是允许它来自指数族中的任何分布。仅仅通过重新参数化我们就扩大了底层分布的范围。例如假设你的数据严重偏斜。高斯分布是完全对称的因此无法准确建模这种不对称但泊松可以。即使分布不同你仍然可以使用相同的底层基础设施。2 更一般地说指数族是回答“给定足够统计量可以从中形成哪些分布”这个问题的最佳答案。在所有重现观测到充分统计量的分布中指数族的假设最少。所以这是对上述问题的自然答案更正式地说指数族分布是给定充分统计量的最大熵分布。为什么最大熵 最小假设。这意味着它是最公正的选择请参见本节末尾的一些示例。3 指数族的所有成员都有共轭先验我们之前详细了解过共轭先验。这对贝叶斯学派来说是个福音。随着新数据的到来模型会轻松更新。因此我们可以在高水平的一般性下进行贝叶斯杂耍涵盖许多分布。4 通常分布的平均值和方差的计算涉及积分。对于指数族均值和方差可以通过计算导数得到。你可能知道导数比积分更容易计算。具体来说均值是aη的一阶导数方差是二阶导数。所以这就是我们Aη的亮点…均值和方差是分布的第一和第二累积量因此Aη也称为累积量函数。我们在附录2中详细讨论了这一点。5 aη 是凸的。η 的自然参数空间也是一个凸集。这简化了优化例如MLE存在且可计算。此外计算也很容易。aη 与 η 的梯度仅为充分统计量 tx 的期望值。这反过来意味着我们可以“匹配矩”来进行MLE。这意味着将模型的期望值 tx设为观测数据的统计量。 参见附录2。6 我们可以自然地将图形模型的力量与指数族分布结合起来。这本身就是一个独立的话题7 任何适用于指数族的高效算法都可以抽象成适用于多种常见分布的算法。像机器学习和推断这样的项目可以在统一框架中处理8 最后还有一些较小的问题。例如在进行反向传播时两个指数族η分布之间的交叉熵梯度仅仅是它们期望参数的差即预测分布的期望充分统计量与真实分布之间的差值。这对优化非常方便因为我们无需计算复梯度。梯度就是预测分布与真实分布期望值的差值9 另一个优点是指数族PDF的乘积和除法与同一指数族的另一个实例成正比。因此我们可以通过简单的加减法来更新参数而非其他昂贵的方法。像期望传播这样的算法正因如此而表现良好。我们现在讲述上述第2点的几个例子该点指出指数族是“给定足够统计量可以从中形成哪些分布”这个问题的偏差最小的答案。如果我们看到充分统计量是 Σxi 和 Σxi²那么最佳无偏选择将是高斯分布量如果我们看到充分统计量只是Σxi并且需要猜测底层分布那么我们的最佳选择是什么答案还取决于我们所关注的定义域对于固定范围0 — n最佳答案是二项式对于离散范围为无限0 — ∞最佳答案是几何对于连续数据0 — ∞答案是指数注意上述三种分布都可以用指数族格式表示。仅通过观察方程并应用领域知识我们就能最好地推测出所涉及的底层分布。一个相关的概念是皮特曼-库普曼-达莫瓦引理。它说只有指数族分布有一个足够统计量其维数不会随着样本量增加而增加。例如一个高斯分布只需二维充分统计量Σxi 和 Σxi²来描述它无论数据点是百万个还是十亿个。来自指数族以外的族有一个警告的数据可能不那么容易总结和压缩。那是什么警告如果数据的范围依赖于参数比如均匀分布不属于前置指数族那么引理不适用。你只需要两个边界值来总结均匀分布对吧无论数据集大小如何。八、附录8.1 附录1——基础测度hx是什么hx 称为“基测度”。测度论本身就是一个艰难的话题而且不是我的专业领域。试图用2到3行来解释并声明这仅供直觉参考。当我们谈论密度时它涉及积分。当我们谈论积分时需要一个基础的计量单位。因此任何概率密度都是相对于某个测度定义的。密度函数通过积分给出概率。到目前为止一切顺利。最简单的测度是勒贝格测度和计数测度。前者赋予实数直线上的每个点均等于零的权重但赋予区间权重等于其长度。计数的度量非常简单就是给每个点一个权重1。由于指数族包含连续分布和离散分布我们可以选择Lebesgue测度用于连续情况选择计数测度表示离散情况。在后一种情况下hx 可以简单地设为 1在前者中它类似于dx和我们学校的微积分一样。标准微积分现在可以假设而无需涉及致命的测度论。现在说说直觉部分。把hx看作概率分布的“基底”或“底层”形状然后再加上那些将该形状拉伸、拉扯或扭曲成最终分布的参数如均值或方差。hx 设定了数据的基础规则例如它是连续还是离散的以及支持的位置例如必须是正的必须介于0和1之间等。注意它不依赖于自然参数。它是分布中定义分布自然几何和核心结构的部分而方程中的指数项包含参数则负责其余形状。之所以称为“基测度”是因为如果你将自然参数设为0只剩下基数。8.2 附录2 — 关于时刻与累积物在处理概率分布时我们通常关注描述其特征。例如对于高斯分布量我们谈论其参数均值峰值所在位置和方差与峰值的分布程度。这些参数对于定义PDF至关重要。不需要更多了。但这并不妨碍我们定义分布的其他特征这些特征本可以更直观帮助我们更好地理解。例如在比较分布时我们可以利用所谓的矩来提供有用的信息。比如我们想知道给定分布是否有“胖尾”。一个叫做峰期的时刻告诉我们这一点。K乌尔托西斯告诉我们一个分布的尾部是比高斯分布更粗还是更细。高斯簇的峰度为3且由于它是常数因此不一定是高斯簇参数集的一部分。我们可以通过平均值/变量组合来完全描述一个高斯量。不过既然峰度能给我们很好的信息使用它就很合理。峰度高于正常表示尾巴较粗低于正常则表示尾巴较细。分布矩定义为数据幂的期望值。设置n1给出了第一个力矩。设置n2则得到第二个力矩依此类推。所以除了结集之外还有许多瞬间。前四个矩——均值矩、方差矩、偏态矩和峰度矩——通常有常用的名称但高阶矩则不使用。更高的矩只是通过斜度和峰度来复现信息我们可以忽略它们。点击这里查看冈德森精彩的博客注意所有矩最终都将表示为分布参数的函数。在某些情况下比如高斯分布早期矩本身就是参数本身。但在其他情况下他们并非如此。矩法是一种估计参数的方法。让我们从泰勒级数的e说起。线性连击的预期只是每个学期的预期所以嘿我们几乎可以在上面的方程中看到所有珍贵的瞬间。我们称左侧的主体为Moment Generating FunctionMGFMGF是一个求和其中第n项包含第n个矩即E[X^n]。通过一些技巧我们可以以简单的方式捕捉这些时刻。怎么做到的首先取MGF的第n导数直指“t”。根据幂律这将将分子中的 t^n 减为 n而 n 与分母中的 n 相抵消最终只剩下 E[Xn]。取导数后前述项也变为0。我们只剩下时刻本身和和中的后续项。接下来我们设t0。这样就排除了除了我们想要的那一刻以外的所有其他术语在原点处计算的MGF的第n次导数就是第n次矩这很好。我们现在可以通过取导数计算MGF的矩。你可能知道处理导数比积分方法简单得多。例如高斯矩可以通过MGF轻松计算而不是走PDF路线。我们之前提到了期望传播算法讨论指数族格式的优势。如果有两个分布px和qx其中p是任意固定分布q是指数族成员。那么我们可以证明通过匹配两个分布的矩例如将qx的均值和方差设为px的从而最小化KL散度。这种匹配矩即期望的特性给出了期望传播算法其核心步骤是通过矩匹配拟合指数族。基本上通过匹配特定矩例如前四个矩我们确保近似q与原始复数p的关键特征高度相似。这是一种计算效率高的方法用于在分解后近似复分布。详见这篇超级博客。8.3 附录3 —累积量如果参数和力矩还不够我们还有累积量。累积量比可视为原始矩的矩稍为精细。它们甚至可以更清晰地定义概率分布的高阶形状并且具有一些不错的性质。它们是自变量的可加性。例如如果我们将两个独立随机变量相加结果的第四次累积量就是各个部分的第四次累积量之和拆分和分析单个部件更容易对吧累量量还能更好地衡量分布形状与正态值的偏差。为什么考虑高斯分布图。它的第三个及更高个累积量为零。因此可以通过观察高阶累积量立即估计另一个分布以高斯分布为例的“非正态”程度。在一直使用“高斯分布”这个术语并且对那些将高斯分布称为正态分布的文本和人表示不满之后我现在意识到他们其实是有理由的。累积量是CumulantG激励F出水CGF的Maclaurin级数展开中的系数CGF定义为MGF的自然对数。麦克劳林级数不过是我们最喜欢的泰勒级数在该列中我们评估导数恰好为t0…是的还是之前的招数第n个累积量是该CGF的第n个导数。事实证明这和我们心爱的aη的n次导数——对数划分函数——是一样的因此aη 也被称为累积函数

相关新闻