
目录前言1. 引言2. 定义期望值3. 样本均值与期望值4. 具有误导性的期望值5. 引入矩6. 众数、均值与中位数7. 结语结语参考前言学习 Steven Brunton 讲授的概率与统计入门概述视频本篇文章记录第二十八讲期望值概率分布的均值记录下个人学习笔记和大家一起分享交流videohttps://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V1. 引言今天我将介绍概率论与统计学中一个相当重要的概念 — 随机变量X XX的期望值其含义是若你反复从该分布中随机采样这些样本的平均值最可能落在哪个数值上这就是期望值的核心含义。对于给定的分布比如关于变量X XX的常规高斯分布对于高斯分布而言期望值恰好与最可能值众数及中位数重合也就是分布的均值μ \muμ但并非所有概率分布和随机变量X XX都符合这种情况有时你会得到反直觉甚至具有误导性的结果稍后我会详细说明这一点。通俗来说期望值就是概率分布的质量中心我们计算期望值的方法本质上是对X XX的所有可能取值进行加权平均权重就是每个取值出现的概率。2. 定义期望值下面我用数学公式来表达我们先从离散型随机变量开始讨论比如伯努利分布、二项分布或泊松分布这类具有离散取值的随机变量其期望值的计算公式为E ( X ) ∑ all k x k P ( X x k ) \mathbb{E}(X) \sum_{\text{all} \, k} x_k P(Xx_k)E(X)allk∑xkP(Xxk)我们将对X XX的所有可能取值进行求和通常这些取值都是整数形式我们将对随机变量X XX所有可能的取值k kk进行求和将随机变量的实际取值x k x_kxk与其对应概率P ( X x k ) P(Xx_k)P(Xxk)相乘后求和这本质上就是随机变量所有可能取值x k x_kxk的加权平均值。假设我正在抛硬币我将一枚均匀硬币抛掷一百次随机变量X XX表示正面朝上的次数接下来我对所有可能的正面朝上次数进行求和若抛掷一百次可能出现零次正面、一次正面、…、直至一百次正面等所有情况。因此我需要将零到一百次的所有可能取值乘以根据二项分布计算得到的对应具体正面次数的概率再进行求和。例如我可以直接查阅帕斯卡三角形来获取这些数值这个计算结果明确显示我最有可能获得 50 次正面若实际得到这个数字我丝毫不会感到意外在 100 次抛硬币实验中期望值应该是 50 次左右。对于连续型随机变量比如高斯正态分布当X XX是连续变量时期望值就需要通过积分来计算E ( X ) ∫ − ∞ ∞ x f ( x ) d x \mathbb{E}(X) \int_{-\infty}^{\infty}xf(x)dxE(X)∫−∞∞xf(x)dx现在随机变量 X 的期望值将等于X XX所有可能取值的积分这实际上就是该分布中所有可能的x xx值与其对应概率f ( x ) d x f(x)dxf(x)dx的加权平均值。OK以上就是离散型随机变量和连续型随机变量的期望值定义。3. 样本均值与期望值这里还有另一种理解方式这种理解方式极其重要且实用这里讨论的主要是概率论范畴但统计学中也有对应的概念。如果我实际收集现实世界中的测量数据比如我进行一百次抛硬币实验并记录结果或者当我随机采访一千名路人测量身高时收集到的样本数据很可能趋近于这些理论分布。因此如果我对X XX进行多次采样假设抽取n nn个样本点若对X XX进行n nn次独立采样并计算平均值则样本均值X ˉ 1 n ∑ j 1 n X j \bar{X} \frac{1}{n} \sum_{j1}^{n}X_jXˉn1j1∑nXj这就是样本均值当n → ∞ n \rightarrow \inftyn→∞时样本均值将收敛于该随机变量的期望值即lim n → ∞ X ˉ E ( X ) μ \lim_{n \rightarrow \infty} \bar{X} \mathbb{E}(X) \mun→∞limXˉE(X)μ这是一个非常重要的结论我们稍后会回到这一点这正是大数定律的核心内容稍后我们将证明这一点但本质上这就是大数定律的表述当对某个分布进行充分采样并计算样本均值时该均值将收敛于该分布的理论期望值样本均值将收敛于该分布的真实均值μ \muμ且当样本量n → ∞ n \rightarrow \inftyn→∞时围绕μ \muμ的方差将趋近于零。这是一个至关重要的结论这也再次说明了期望值的实际意义它是该随机变量多次试验平均值的极限稍后我们将通过编程来实际验证这一点我们将进行 100 次抛硬币实验观察结果如何逐步收敛我们将多次重复实验观察这些样本均值的方差变化这将帮助我们深入理解统计数据的特性。我们也可以反过来思考如果收集了 50 个样本并得出均值该如何进行推理实际从这个特定分布中采样的可能性有多大我得到的这组样本序列在已知其均值和方差的情况下究竟有多大可能性会出现4. 具有误导性的期望值这种方法非常实用且简单但也可能产生相当大的误导性这里我想指出几个容易产生误导的地方图中粉色曲线是一个高斯分布其均值μ \muμ即为期望值黄色曲线是另一个完全不同的分布黄色分布具有完全相同的期望值即分布的质量中心完全重合。实际上该双峰分布在均值μ \muμ处的概率密度极低甚至可能为零—所有权重都集中在两个双峰峰值处从该分布中几乎不可能抽到接近μ \muμ值的样本。这确实有些奇特在形态奇特的分布中确实可能出现各种异常现象我需要其他数值和参数来定义这个分布并将两者区分开来其中一个关键数值就是标准差。因此期望值本质上是一种平均值标准差或方差用于衡量数据分布的离散程度显然黄色曲线的离散程度高于粉色曲线这正是两者的区别所在。5. 引入矩这被称为一阶矩期望值是一阶矩其概念类似于转动惯量这确实与矩的概念十分相似方差和标准差与二阶矩密切相关实际上还存在更高阶的矩例如三阶矩、四阶矩、五阶矩等等这些高阶矩共同构成了概率分布的独特 “指纹”。因此若已知黄色分布与粉色分布的全部矩就能深入分析二者的特性并加以区分这就像函数的泰勒级数展开这就像将概率密度函数按均值、标准差、三阶矩、四阶矩、五阶矩等参数展开。这里需要说明的是期望值、方差等这些统计量就是被称为矩期望值就是一阶矩二阶矩对应方差或标准差随着阶数递增还会存在更高阶矩如三阶、四阶等这些矩如同概率密度的指纹特征类似于泰勒级数展开的形式后续我们将运用这一特性这确实是个引人入胜的领域。这与概率密度函数的拉普拉斯变换密切相关拉普拉斯变换在概率统计中无处不在最精妙的体现莫过于能生成各阶矩的矩母函数不过这是后话了。其实我想说明的是即使两个分布具有相同的期望值它们也可能截然不同而且期望值本身并不代表该点附近是分布的高概率区域这确实有些反直觉因此期望值未必是X XX最可能出现的取值。6. 众数、均值与中位数接下来我将明确定义几个关键概念X XX最可能出现的取值称为众数这是函数中出现概率最高的X XX取值。此外还有均值或者说平均值这正是我们前面计算的结果这就是期望值这是一种加权平均的概念。第三种数值是中位数这通常是统计学中最实用的指标在存在异常值或特殊分布的情况下这就是我们所说的分布中心它实际上就是位于分布正中心的数值。接下来我将逐一阐述并定义这些概念但我想特别指出中位数具有稳健性这一特性这是一种稳健的统计方法因此当存在异常值时期望值对异常值会高度敏感中位数对异常值具有极强的稳健性。我说的异常值是指什么让我举个例子来说明假设我们来看财富分布的情况比如美国民众银行账户里的存款金额假设其标称形式如下所示这个分布呈现明显的峰值特征同时两侧拖曳着厚重的尾部这代表某个国家民众的财富分布状况但在分布曲线的最远端存在着像比尔·盖茨和埃隆·马斯克这样的极端值这些拥有千亿美元净资产的超级富豪群体其数量必然极为稀少但这会显著拉高整体平均值。因此若剔除这些异常值实际分布的均值会明显偏离预期水平但中位数具有稳健性能准确反映此处的分布峰值。我特意查证了相关数据美国家庭财富中位数约为 20 万美元这个数值大致对应该分布的峰值区域家庭平均财富为 100 万美元这几乎完全是由于极端离群值的存在所致因此这些异常值不仅略微拉高了均值更是使其增长了五倍之多。这些分布在尾端的异常数据 — 无论是罕见事件还是离群值 — 所蕴含的财富总量正在改变整个分布的期望值因此分布的中位数 — 即位于中间位置的值 — 对于另一侧少数异常值的干扰具有更强的稳健性。现在我来具体说明其含义分布的中位数是满足累积分布函数值为1 2 \frac{1}{2}21的X XX值这意味着恰好一半概率落在左侧另一半概率落在右侧。众数是出现概率最高的取值即概率密度函数在X XX处取得最大值的点可将其表示为P ( x ) max P(x)_{\max}P(x)max这种表述同样成立。均值或平均值就是X XX的期望值。7. 结语OK这部分内容确实不少我想说的应该就是这些了本质上期望值是概率论与统计学中一个非常有用的量它是描述分布特征最重要的数值之一但并非唯一重要的数值我还需要了解方差及更高阶矩的信息。它对异常值极为敏感因此若存在异常值或罕见事件中位数或许是更稳健的选择但期望值计算简便且在大样本极限下样本均值会收敛于统计中的期望值这就是大数定律我们稍后会进行证明。结语期望值是概率分布的 “质量中心”—E ( X ) ∑ x k P ( X x k ) \mathbb{E}(X) \sum x_k P(Xx_k)E(X)∑xkP(Xxk)离散或∫ x f ( x ) d x \int x f(x)dx∫xf(x)dx连续—这一简洁定义背后承载着从赌博赔率到物理质心再到统计推断的广泛解释力。Brunton 揭示了大数定律LLN赋予期望值的操作意义X ˉ 1 n ∑ X j → n → ∞ E ( X ) μ \bar{X} \frac{1}{n}\sum X_j \xrightarrow{n\to\infty} \mathbb{E}(X) \muXˉn1∑Xjn→∞E(X)μ—样本均值是期望值的 “观测实现”期望值是样本均值的 “理论极限”。这为统计学中的参数估计提供了最根本的理论保证。然而本讲也以双峰分布和财富分布两个例子发出重要警告期望值≠典型值。两个期望值完全相同的分布可能形态迥异单峰 vs 双峰从双峰分布中甚至几乎不可能抽到恰好等于μ \muμ的样本。财富分布的案例更具冲击力美国家庭财富中位数约 20 万美元但均值却因极少数亿万富翁的存在而被拉到 100 万美元—期望值对异常值极度敏感离群值的杠杆效应可达 5 倍之多。由此自然引出描述分布所需的完整工具链众数最可能值、中位数F ( x ) 0.5 F(x)0.5F(x)0.5异常值稳健、均值期望计算简便但敏感。这三个 “中心度量” 分别捕捉了分布的不同侧面。进一步地Brunton 将期望值置于矩moments的统一框架中—一阶矩 期望位置二阶矩 方差离散度更高阶矩 偏度、峰度等——这些矩如同分布的 “泰勒展开系数”共同构成概率密度的独特指纹。后续的矩母函数moment generating function将提供从分布中统一提取所有矩的生成器视角 。参考https://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V