尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

杜克大学 R 数据分析笔记(二)

杜克大学 R 数据分析笔记(二) 这意味着Pam的分数比84.13%的SAT考生要好。我们也可以使用表格得出相同的结论。首先计算Z分数(1800 - 1500) / 300 1。然后在表格中查找Z分数1.0行1.0列.00得到相同的概率0.8413即获得小于1的Z分数的概率这基本上意味着曲线下1800以下的阴影面积为0.8413。如前所述你不需要对每个问题都使用所有这些方法但我们在这里练习了所有方法。请注意表格和pnorm函数总是给出给定观测值以下的曲线下面积。如果我们想找到观测值以上的面积我们只需要取这个值的补数因为曲线下的总面积总是1。所以Pam比1 - 0.8413 15.87%的考生考得差。寻找特定百分位数对应的分数 我们也可以利用标准正态分布即Z分数的分布的相同性质来寻找与所需百分位数对应的临界值。下面是一个说明这一点的例子。你的一个朋友告诉你她的SAT成绩排在前10%。她可能得到的最低分数是多少记住SAT分数服从正态分布均值为1500标准差为300。我们正在寻找分布中前10%的临界值。这是一个与我们之前解决的问题不同的问题因为这次我们不知道感兴趣的观测值但我们知道或至少可以得到它的百分位分数。由于曲线下的总面积为1与前10%临界值相关的百分位分数是1 - 0.10 0.90。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/dd3636922b0f303a27d6c67c0409fccd_27.png记住Z分数的公式是Z (观测值 - 均值) / 标准差。我们知道均值也知道标准差。如果我们还知道Z分数我们就可以解出未知的观测值。使用表格我们可以找到与第90百分位数相关的Z分数。我们需要在表格中找到0.90并从表格边缘获取Z分数。我们没有看到正好0.9但最接近的是0.8997对应表格边缘的Z分数是1.28。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/dd3636922b0f303a27d6c67c0409fccd_29.png我们知道这个数字1.28等于未知观测值我们称之为x减去均值除以标准差。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/dd3636922b0f303a27d6c67c0409fccd_31.png通过简单的代数运算两边乘以300再加上1500我们发现临界值是1884。因此SAT分数分布中前10%或后90%的临界值是1884。换句话说如果你的分数高于1884你就知道自己在分布的前10%之内。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/dd3636922b0f303a27d6c67c0409fccd_29.png我们也可以使用R来做这个计算这次使用qnorm函数pnorm用于概率qnorm用于分位数或临界值。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/dd3636922b0f303a27d6c67c0409fccd_31.pngqnorm(0.90,mean1500,sd300)# 输出 1884两种方法得到的结果相同1884。总结 在本节课中我们一起学习了正态分布的核心概念。我们了解了正态分布是单峰、对称的钟形曲线由均值μ和标准差σ两个参数描述。我们掌握了68-95-99.7法则它描述了数据围绕均值分布的规律。我们引入了标准化Z分数的概念及其计算公式Z (X - μ) / σ并学会了如何利用Z分数在正态分布中计算百分位数曲线下面积以及根据特定百分位数反推原始分数。最后我们探讨了使用R语言函数pnorm,qnorm、网络工具和概率表等多种方法来实现这些计算。理解这些内容是进行统计推断和数据分析的重要基础。025正态分布评估 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c59c63a2f3a7241fff056d33453ca2ce_1.png在本节课中我们将学习如何评估一个数据分布是否近似于正态分布。我们将重点介绍正态概率图并解释如何通过它以及68-95-99.7法则来判断数据的正态性。正态概率图简介https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c59c63a2f3a7241fff056d33453ca2ce_3.png上一节我们介绍了正态分布的基本概念本节中我们来看看如何通过可视化工具进行判断。正态概率图是一种特殊的散点图用于评估数据分布与正态分布的接近程度。在该图中Y轴代表我们观测到的实际数据值而X轴代表理论分位数即如果数据完全服从正态分布时我们预期会出现的数值。如果数据与理论分位数之间存在一一对应的关系那么数据就遵循一个近似正态的分布。由于一一对应的关系在散点图上会呈现为一条直线因此点越接近一条完美的直线我们就越有信心认为数据遵循正态模型。所以观察正态概率图时我们主要寻找直线。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c59c63a2f3a7241fff056d33453ca2ce_5.png如何解读正态概率图以下是解读正态概率图时可能遇到的几种模式右偏分布数据点会向上并向直线的左侧弯曲。左偏分布数据点会向下并向直线的右侧弯曲。短尾分布比正态分布更窄数据点会呈现一个S形曲线。长尾分布比正态分布更宽数据点会从直线下方开始然后穿过直线最后运行到直线上方。实例分析NBA球员身高让我们通过一个实例来加深理解。下图展示了2008-2009赛季NBA球员身高的直方图与正态概率图。由于NBA球员的身高普遍远高于普通人群其身高分布是左偏的。在正态概率图上这种左偏表现为数据点向下并向理论直线的右侧弯曲。我们还可以看到数据点有跳跃这实际上是由于报告身高时进行了四舍五入造成的。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c59c63a2f3a7241fff056d33453ca2ce_7.png使用68-95-99.7法则评估除了正态概率图我们还可以运用68-95-99.7法则来评估正态性。具体方法是计算数据中落在均值±1个标准差、±2个标准差、±3个标准差范围内的比例并与理论值68% 95% 99.7%进行比较。如果实际比例与理论值接近则可以为数据服从正态分布提供了支持。总结https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c59c63a2f3a7241fff056d33453ca2ce_9.png本节课中我们一起学习了评估数据正态性的两种主要方法观察正态概率图寻找数据点是否紧密排列在一条直线上并根据点的弯曲方向判断偏态与峰态。应用68-95-99.7法则通过计算实际数据在特定标准差范围内的比例与理论预期进行对比。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c59c63a2f3a7241fff056d33453ca2ce_11.png在实践中由于手动计算分位数和Z分数非常繁琐我们通常依赖R语言等统计软件来生成正态概率图并进行计算。掌握这些评估方法能帮助我们在进行后续的统计推断如t检验、方差分析、线性回归前确认数据是否满足正态性假设。026正态分布应用https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c2adf812e88e5c69ebe0b3ded0043c2e_0.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c2adf812e88e5c69ebe0b3ded0043c2e_2.png在本节课中我们将学习如何应用正态分布模型来解决实际问题。我们将通过两个具体的例子演示如何使用不同的工具和方法来计算概率和百分位数。概述正态分布是数据分析中一个非常重要的模型。许多自然现象和测量数据都近似服从正态分布。我们将通过两个案例来学习如何利用正态分布的特性进行计算第一个案例是计算行李超重的概率第二个案例是找出特定百分位数对应的温度值。案例一计算行李超重概率假设某航空公司乘客托运行李的重量近似服从正态分布其均值为45磅标准差为3.2磅。大多数航空公司对超过50磅的行李收取额外费用。我们需要计算有多少比例的乘客需要支付这笔费用。行李重量服从正态分布均值为45标准差为3.2我们可以将其表示为N(μ45, σ3.2)。我们的目标是计算重量超过50磅的概率即P(X 50)。以下是几种不同的计算方法。方法一使用在线模拟工具https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/c2adf812e88e5c69ebe0b3ded0043c2e_4.png我们可以访问一个正态分布模拟工具来完成计算。在工具中我们将分布类型设置为“正态”均值设置为45标准差设置为3.2。然后我们将关注的分界值cutoff value滑动到50。工具会显示大约有5.91%的乘客的行李重量会超过50磅。方法二使用R语言的pnorm函数在R语言中我们可以直接使用pnorm函数。该函数计算给定值左侧小于该值的概率。pnorm(50,mean45,sd3.2)运行上述代码会得到结果0.9409。这表示重量低于50磅的概率是94.09%。然而我们关心的是超过50磅的概率即右侧的概率。因此我们需要计算其补集1-pnorm(50,mean45,sd3.2)计算结果是0.0591即大约5.91%的乘客需要支付超重费用。方法三手动计算Z分数并使用概率表我们也可以手动计算Z分数然后查标准正态分布表。首先计算观测值50对应的Z分数Z (观测值 - 均值) / 标准差 (50 - 45) / 3.2 ≈ 1.56然后在标准正态分布表中查找Z1.56对应的概率值。在表中Z1.56对应的概率约为0.9406。这同样是重量低于50磅的概率。因此重量超过50磅的概率为1 - 0.9406 0.0594 ≈ 5.9%三种方法得出的结论一致大约有5.9%的乘客的行李会超重。案例二计算特定百分位数对应的温度现在我们来看第二个问题。洛杉矶六月份的平均日最高气温为77华氏度标准差为5华氏度。假设气温近似服从正态分布。我们需要找出六月份洛杉矶最冷的20%的日子其气温低于多少度。这里我们已知分布N(μ77, σ5)和一个概率20%需要反推出对应的观测值温度。这涉及到计算百分位数。方法一使用R语言的qnorm函数在R语言中我们可以使用qnorm函数它根据给定的概率百分位返回对应的分位数。qnorm(0.20,mean77,sd5)运行代码得到结果72.79。这意味着六月份洛杉矶最冷的20%的日子其最高气温低于72.79华氏度。方法二手动计算Z分数并使用概率表我们也可以手动完成这个过程。首先我们需要找到概率0.20对应的标准Z分数。在标准正态分布表中查找最接近0.20的概率值。我们发现概率值0.2005对应的Z分数是-0.84因为我们在分布的低端所以Z分数为负。接下来我们利用Z分数的公式反推观测值XZ (X - μ) / σ -0.84 (X - 77) / 5解这个方程X - 77 -0.84 * 5 X - 77 -4.2 X 77 - 4.2 72.8因此最冷的20%的日子的气温低于大约72.8华氏度。这与R计算的结果非常接近。总结在本节课中我们一起学习了正态分布的两个核心应用。首先我们学习了如何计算某个特定值以上的概率右尾概率。我们使用了三种工具在线模拟工具、R语言的pnorm函数以及手动计算Z分数查表法。核心公式是Z (X - μ) / σ。其次我们学习了如何根据已知的概率百分位来反推对应的观测值。我们使用了R语言的qnorm函数以及手动查表并利用Z分数公式反推的方法。掌握这些方法你就能灵活运用正态分布模型来解决各种实际问题无论是预测概率还是确定关键阈值。027二项分布 在本节课中我们将要学习二项分布。我们将定义二项分布讨论其性质并列出随机变量服从二项分布所需的条件。我们还将学习如何使用网络计算器、R语言以及手动计算来求解二项分布下的概率。最后我们将评估二项分布的特征例如其均值和标准差。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_1.png二项分布的定义与性质上一节我们介绍了课程概述本节中我们来看看二项分布的具体定义。我们将通过一个经典的心理学实验来展开讨论。这个实验由耶鲁大学心理学家斯坦利·米尔格拉姆在20世纪60年代开始进行。实验测量了参与者在权威人士的指令下执行与自己个人良知相冲突的行为的意愿。实验设置如下实验者命令“教师”在“学习者”每次答错问题时给予其强烈的电击。“教师”是研究的对象而“学习者”实际上只是一名演员。电击并非真实每次“教师”实施电击时会播放预先录制的声音因此“教师”认为自己真的在电击他人。米尔格拉姆发现大约65%的人会服从权威并给予此类电击。多年来后续研究表明这个数字在不同社区和时代大致保持一致。在米尔格拉姆的实验中每个人可以被视为一次试验。如果一个人拒绝实施强烈电击则被标记为“成功”如果她实施了此类电击则被标记为“失败”。由于只有35%的人拒绝实施此类电击因此成功的概率P 0.35。请注意我们在此处可以按需定义“成功”和“失败”因为在后续分析中我们将重点关注那些拒绝实施电击的人。当一个单独的试验只有两种可能结果时它被称为伯努利随机变量。计算概率一个具体例子假设我们随机选择四个人参与这个实验。恰好有一个人拒绝实施电击的概率是多少我们将这四个人命名为安东尼、布列塔尼、克拉拉和多里安分别用A、B、C、D表示。我们感兴趣的是四人中有一人拒绝实施电击的情况这有多种可能发生的场景。以下是所有可能的场景场景一第一个人拒绝其余三人不拒绝。概率为0.35 * 0.65 * 0.65 * 0.65 0.0961场景二第一个人不拒绝第二个人拒绝其余两人不拒绝。概率为0.65 * 0.35 * 0.65 * 0.65 0.0961场景三前两人不拒绝第三个人拒绝最后一人不拒绝。概率为0.65 * 0.65 * 0.35 * 0.65 0.0961场景四前三人不拒绝最后一个人拒绝。概率为0.65 * 0.65 * 0.65 * 0.35 0.0961这些是互斥的场景它们不可能同时发生。因此当我们说“场景一或场景二或场景三或场景四”时我们将各个概率相加。所以恰好一人拒绝的总概率是0.0961 0.0961 0.0961 0.0961 0.3844。我们也可以这样得到答案将单个场景的概率乘以场景的总数。在第一个计算完成后我们可以快速找出有多少种场景然后简单地将一个场景的概率乘以场景数即可得到相同答案。二项分布公式这种情况是应用二项分布的完美场景。该分布描述了在n次独立的伯努利试验中恰好获得k次成功的概率其中每次试验的成功概率为p。我们证明了该概率可以计算为场景数乘以单个场景的概率。单个场景的概率是p^k * (1-p)^(n-k)。这意味着成功概率的成功次数次方乘以失败概率的失败次数次方。场景数是选择k次成功发生在n次试验中的方式数。为了找到场景数我们之前枚举了所有可能场景。但这仅在数量较少时可行。如果数量很多例如在100次试验中寻找4次成功的场景数这种方法将非常繁琐且容易出错。因此我们通常使用另一种方法即组合函数它用于计算从n次试验中选择k次成功的方式数。该函数的计算公式为n choose k n! / (k! * (n-k)!)让我们看几个例子例子1在4次试验中找到1次成功的场景数。n 4,k 1。4 choose 1 4! / (1! * 3!) (4*3*2*1) / (1 * 3*2*1) 4。我们之前已经知道有4种场景。例子2在9次试验中找到2次成功的场景数。n 9,k 2。9 choose 2 9! / (2! * 7!) (9*8*7!) / (2*1 * 7!) 72 / 2 36。这些手动计算很好但为了加快速度我们也可以在R中使用计算。相关的函数也叫choose它接受两个参数n和k。例如choose(9, 2)同样得到36。二项分布公式总结将所有这些放在一起如果p代表成功概率(1-p)代表失败概率n代表独立试验的次数k代表成功的次数那么在n次试验中获得k次成功的概率可以表示为P(X k) (n choose k) * p^k * (1-p)^(n-k)其中(n choose k) n! / (k! * (n-k)!)https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_3.png二项分布的条件现在我们已经知道如何应用这些公式计算二项概率让我们暂停一下退一步思考一个随机变量要服从二项分布需要满足什么条件https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_5.png以下是四个条件试验必须是独立的。试验次数n必须是固定的。每次试验的结果必须被分类为“成功”或“失败”。每次试验的成功概率p必须相同。第四个条件实际上与第一个条件密切相关因为如果试验是独立的那么可以合理地确定每次试验的成功概率是相同的。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_7.png应用实例员工敬业度根据2013年盖洛普的一项调查全球只有13%的员工在工作中是“敬业”的“敬业”指心理上投入工作并可能为组织做出积极贡献。在一个由10名员工组成的随机样本中恰好有8人敬业的概率是多少首先解析我们得到的信息我们有10名员工所以n 10。13%的人敬业所以成功概率p 0.13。失败概率是其补集1 - p 0.87。我们寻找8次成功所以k 8。我们可以使用二项分布来求这个概率因为我们实际上满足二项分布所需的条件我们有员工的随机样本因此满足独立试验条件。由于试验独立每名员工的成功概率为p 0.13。对每名员工只有两种可能结果敬业或不敬业。我们有固定的试验次数n 10。因此要找到10次试验中8次成功的概率我们首先使用10 choose 8计算场景数然后乘以一个场景的概率p^8 * (1-p)^2。计算过程10 choose 8 10! / (8! * 2!) (10*9*8!) / (8! * 2*1) 90 / 2 45种场景。每个场景的概率0.13^8 * 0.87^2。最终概率非常小45 * (0.13^8 * 0.87^2) ≈ 2.78e-07。为什么这是一个很低的概率因为如果成功概率只有13%那么在10名员工中我们预计敬业的人数远少于8人。因此我们在这里寻找的是一个高度不可能的结果。使用R和计算器我们也可以使用R来计算相同的概率。在R中我们使用dbinom函数其中第一个参数是成功次数k第二个参数是试验次数n第三个参数是成功概率p。dbinom(8, 10, 0.13)会得到与我们手动计算相同的微小概率。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_9.png另一种方法是使用分布计算器小程序。我们可以选择分布为二项分布设置n10p0.13然后查找k8对应的概率。图表中每个条形代表一个可能的结果条形的高度代表该结果的概率。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_11.png二项分布的均值与标准差在一个由100名员工组成的随机样本中你预计有多少人会敬业记住p 0.13。这很简单预计的敬业员工人数是100 * 0.13 13。更正式地说二项分布的期望值或均值等于n * p。但这并不意味着在每100名员工的随机样本中恰好有13人敬业。在某些样本中敬业员工的数量会较少而在另一些样本中会较多。那么我们预计这个值会有多大变化像往常一样我们可以用标准差来量化均值周围的变异性。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_13.png对于二项分布标准差定义为标准差 sqrt( n * p * (1-p) )代入调查中的值我们得到sqrt(100 * 0.13 * 0.87) ≈ 3.36这意味着预计100名员工中有13人敬业上下浮动大约3.36人。请注意二项分布的均值和标准差可能不总是整数这没关系这些值代表了我们平均预期会看到的情况。总结https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ff715621f60c34f6d38c4c6eddca9e30_15.png本节课中我们一起学习了二项分布。我们通过米尔格拉姆实验的例子引入了二项分布的概念学习了其概率计算公式P(Xk) C(n,k) * p^k * (1-p)^(n-k)并明确了随机变量服从二项分布的四个条件试验独立、试验次数固定、结果二分、概率恒定。我们还通过员工敬业度的例子实践了概率计算并介绍了二项分布的均值μ n*p和标准差σ sqrt(n*p*(1-p))的计算方法。最后我们了解了如何使用R语言和计算工具来辅助求解二项分布问题。028二项分布的正态近似 在本节课中我们将要学习二项分布的形状如何随参数变化并探讨当试验次数增加时二项分布如何逐渐接近正态分布。我们将学习利用正态分布的计算方法来近似求解二项分布的概率问题。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_1.png二项分布的形状变化 上一节我们介绍了二项分布的基本概念本节中我们来看看它的形状如何随参数变化。假设我们有一个二项随机变量其成功概率p 0.25。下图展示了当试验次数n 10时该分布的形状。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_1.png让我们暂停一下仔细观察这张图。每个条形代表在10次试验中可能出现的成功次数范围从0到10因此共有11个条形。条形的高度代表该结果出现的可能性。例如0次成功的概率计算公式为(0.75)^10因为0次成功意味着10次失败计算结果约为0.056即该条形的高度。当n 10p 0.25时期望成功次数为2.5因此分布围绕这个值中心化。此时二项分布是右偏的。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_3.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_4.png让我们保持p 0.25不变将样本量增加到n 20。我们看到分布的中心发生了变化因为n * p不同了同时形状也发生了变化。分布虽然仍是右偏但偏斜程度大大降低。将样本量进一步增加到n 50分布看起来更加对称和平滑。当样本量增加到n 100时分布看起来与正态分布几乎没有区别。应用场景Facebook用户研究案例 接下来我们通过一个Facebook用户研究的案例看看为什么这种近似关系很有用。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_3.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_4.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_6.png一项近期研究发现Facebook用户“得到”的往往多于“付出”。例如样本中40%的用户曾发出好友请求但63%的用户至少收到过一个请求。用户平均为好友内容点赞14次但自己的内容平均被点赞20次。用户平均发送9条私信但收到12条。12%的用户在照片中标记过朋友但35%的用户自己被标记过。这种现象的解释是“超级用户”的存在即那些贡献内容远多于普通用户的用户。研究还发现25%的Facebook用户被认为是超级用户且平均每个用户有245个好友。我们的问题是一个拥有245个好友的平均Facebook用户其好友中有70个或更多是超级用户的概率是多少以下是问题中的关键信息成功概率p 0.25好友是超级用户。试验次数n 245好友总数。我们感兴趣的概率是成功次数k 70至少有70个超级用户好友。正态近似法的应用 我们有n 245次独立试验每次试验一个好友的结果是成功超级用户或失败非超级用户每次成功的概率固定为p 0.25。下图是n 245p 0.25的二项分布图我们感兴趣的是k 70的概率即从70到245所有可能成功次数的概率之和。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_6.png我们可以用二项公式计算从70到245每一个结果的概率然后相加但这非常繁琐。此时二项分布与正态分布的相似性就派上用场了。图中蓝色阴影区域的面积可以用一条平滑的正态曲线下的面积来近似计算这比计算并累加大量二项概率要简单得多。要计算正态概率我们需要知道正态分布的参数这可以通过原二项分布的均值和标准差来估计。均值μ n * p 245 * 0.25 61.25标准差σ sqrt(n * p * (1-p)) sqrt(245 * 0.25 * 0.75) ≈ 6.78这意味着在245个好友中我们期望有约61.25个超级用户标准差约为6.78。给定观测值x 70、均值μ和标准差σ我们可以通过计算Z分数来求曲线下的面积。Z分数公式Z (x - μ) / σ (70 - 61.25) / 6.78 ≈ 1.29https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_8.png由于我们关注的是观测值70右侧的阴影区域我们需要计算Z 1.29的概率。查标准正态分布表Z 1.29对应的左侧面积为0.9015。因此Z 1.29的概率为1 - 0.9015 0.0985。所以一个拥有245个好友的平均Facebook用户其好友中至少有70个超级用户的概率约为9.85%。精确计算与连续性校正 我们也可以直接使用R语言的dbinom函数进行精确计算。# 计算从70到245所有成功次数的概率之和sum(dbinom(70:245,size245,prob0.25))计算结果约为0.113或11.3%与我们之前近似得到的0.0985略有不同。一方面这在意料之中因为“正态近似”本身就是一种近似。另一方面如果需要精确概率这个差异可能令人困扰。让我们仔细对比二项分布和它的正态近似。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_10.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_8.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_12.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_13.png我们可以看到红色的正态曲线与代表精确二项概率的条形略有不同。此外在连续的正态分布下“恰好70次成功”的概率是未定义的因此70右侧的阴影面积并未完全包含“70次成功”的概率。一个常见的修正方法是进行0.5的连续性校正。即用69.5代替70来计算Z分数。校正后Z分数Z (69.5 - 61.25) / 6.78 ≈ 1.22查表得Z 1.22对应左侧面积0.8888因此右侧概率为1 - 0.8888 0.1112经过连续性校正后近似结果0.1112与精确二项结果0.113就非常接近了。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_15.png使用在线工具计算 ️另一种计算二项分布概率的方法是使用在线统计计算器Applet。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_12.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_13.png操作步骤如下选择“二项分布”。将试验次数n滑动到245。将成功概率p滑动到0.25。将临界值设置为70。选择计算“上尾”概率大于或等于。计算结果再次确认了11.3%这个精确概率。成功-失败条件与总结 在刚才的例子中我们通过绘图直观地确认了二项分布是单峰、对称且近似正态的。但如果我们无法绘图如何判断样本量是否足够大可以放心地使用正态近似呢经验法则是成功-失败条件一个二项分布当期望成功数n * p 10且期望失败数n * (1 - p) 10时可以认为它近似服从正态分布。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_17.png在这种情况下我们可以用均值为μ n * p、标准差为σ sqrt(n * p * (1-p))的正态分布来近似它。为了获得更精确的近似概率可以对观测值进行0.5的连续性校正。让我们做一个快速练习对于成功概率p 0.25的二项分布要使其近似正态分布所需的最小样本量n是多少根据条件一n * 0.25 10n 40根据条件二n * 0.75 10n 13.33取两者中较大的值因此最小需要40次观测。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_19.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/63c653b78680bd31615a8ff653f498f4_19.png本节课总结本节课中我们一起学习了二项分布的形状如何随参数变化。我们了解到当试验次数足够大时满足成功-失败条件二项分布的形状会非常接近正态分布。这使得我们可以利用更简单的正态概率计算方法来近似求解复杂的二项概率问题。我们还介绍了连续性校正来提高近似的精确度并通过Facebook的案例演示了整个应用过程。理解二项分布的正态近似是后续对二分类型变量进行统计推断的重要基础。029二项分布应用 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_0.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_1.png在本节课中我们将学习如何应用二项分布来解决实际问题。我们将通过一个具体的案例计算在不同样本量下特定事件发生的概率并探讨如何使用计算工具如模拟程序、R语言以及正态近似法来求解。课程将涵盖概率计算、分布形状的判断以及连续性校正的概念。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_3.png根据民意调查计算概率 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_5.png根据2014年盖洛普民意调查在计划购买健康保险的未参保美国人中有56%的人表示将通过政府医疗保险交易所购买。问题在一个由10人组成的随机样本中恰好有6人计划通过政府医疗保险交易所购买健康保险的概率是多少上一节我们介绍了二项分布的基本概念本节中我们来看看如何应用这些概念进行计算。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_7.png使用模拟程序计算我们可以使用二项分布模拟程序来简化计算。以下是具体步骤选择分布类型为二项分布。设置样本量n 10。设置成功概率p 0.56。选择计算“等于”恰好6次成功的概率。计算结果为0.243即24.3%。这意味着在10人的随机样本中恰好有6人计划通过政府交易所购买保险的概率是24.3%。使用R语言计算作为替代方法我们可以使用R语言中的dbinom函数进行计算。dbinom(6,size10,prob0.56)执行此代码将得到相同的答案0.243。手动计算我们也可以通过手动计算来验证结果。我们要求的是在10次试验中恰好有6次成功的概率。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_9.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_10.png计算公式为P(X 6) C(10, 6) * (0.56)^6 * (0.44)^4其中C(10, 6)是组合数。展开计算后我们同样会得到结果0.243。在二项分布图中这个概率对应于成功次数为6的条形图高度。考虑到我们期望的成功次数是10 * 0.56 5.6得到6次成功是一个可能性较高的结果。大样本下的概率变化趋势 现在让我们看看另一个问题。问题在一个由1000人组成的随机样本中恰好有600人计划通过政府医疗保险交易所购买健康保险的概率是多少选项是A) 0.243与之前n10时相同 B) 小于0.243 C) 大于0.243。这个问题旨在评估推理和概念理解而非计算能力。上一节我们计算了小样本下的精确概率本节中我们来推理大样本下的变化趋势。推理过程成功概率p仍为0.56。在之前n10的练习中期望成功次数为5.6目标值6与期望值的差距为0.4。在当前n1000的练习中期望成功次数为1000 * 0.56 560目标值600与期望值的差距为40。目标结果离期望结果远得多。根据我们之前讨论的大数定律当期望值为560时获得600次成功应该比期望值为5.6时获得6次成功的可能性低得多。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_12.png因此答案是小于0.243。我们可以用R快速验证dbinom(600,size1000,prob0.56)计算结果约为0.00098远低于之前计算的0.243。描述二项分布的形态 接下来我们被要求描述一个随机样本量为100时计划通过政府交易所购买保险的人数的概率分布。已知p 0.56n 100。这个样本量足够大吗我们来看看它是否满足近似正态分布的条件。判断分布是否近似正态的规则是至少需要有10次期望成功和10次期望失败。期望成功次数100 * 0.56 5610期望失败次数100 * 0.44 4410两个条件都满足因此该二项分布的形态将是近似正态的。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_14.png正态分布有两个参数均值μ和标准差σ。要完整描述这个分布我们需要计算它们。均值期望成功次数μ n * p 100 * 0.56 56标准差σ sqrt(n * p * (1-p)) sqrt(100 * 0.56 * 0.44) ≈ 4.96因此这个二项分布可以近似看作一个均值为56、标准差为4.96的正态分布。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_16.png计算累积概率至少60人 最后我们考虑以下问题在一个100人的随机样本中至少有60人计划通过政府交易所购买健康保险的概率是多少我们将展示多种解决方法你可以选择其中一种掌握即可。方法一使用模拟程序https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_18.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_19.png以下是使用模拟程序的步骤分布类型选择二项分布。试验次数n设为100。成功概率p设为0.56。将关注点的值设为60。我们寻找的是“大于或等于”60的概率因此选择计算上尾面积。结果显示概率为24.1%。方法二使用R语言我们可以再次利用R语言结合dbinom和sum函数。sum(dbinom(60:100,size100,prob0.56))这段代码计算了成功次数从60到100的所有个体概率之和结果同样是0.241或24.1%。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_21.png方法三正态近似法含连续性校正我们已知该分布近似正态μ 56σ ≈ 4.96。首先计算Z分数Z (观察值 - 均值) / 标准差 (60 - 56) / 4.96 ≈ 0.81查标准正态分布表对应概率约为0.209。这个结果比用模拟程序和R计算出的精确概率0.241要低。差异主要是因为正态分布是连续的而二项分布是离散的。为了修正这一点我们应用连续性校正将关注的观察值60减去0.5。计算校正后的Z分数Z_corrected (59.5 - 56) / 4.96 ≈ 0.71查表得校正后的概率约为0.239这个结果与精确二项分布计算出的概率0.241就非常接近了。总结 ✨https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/duke-r-dtanls/img/ad5c20e7ce68fedd29d969f039b5d307_23.png本节课中我们一起学习了二项分布在数据分析中的实际应用。我们通过一个案例计算了在不同样本量下特定成功次数的概率并比较了使用模拟程序、R语言以及手动计算等多种方法。我们了解到当样本量足够大时二项分布可以近似用正态分布来描述但在计算累积概率时需要注意使用连续性校正来提高近似精度。这些技能对于进行统计推断和概率建模至关重要。
返回列表