尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

EViews实证案例解析:从回归分析到AR(1)自相关修正

EViews实证案例解析:从回归分析到AR(1)自相关修正 简介计量经济学Eviews操作案例集精选了2021至2022年间积累的教学素材面向高校经管类本科生、研究生以及需要独立完成计量分析的自学者。压缩包共1个文件为doc格式文档大小约2.02MB内容以文字、公式和表格形式呈现聚焦Eviews软件在经济建模中的典型应用。案例一围绕改革开放以来我国边际消费倾向的估计完整呈现经济理论、数据处理、数学模型设定、参数估计、假设检验和预测等八个步骤并通过加入前期消费值比较不同模型的差异案例二以2002年各地区城市居民人均消费支出与可支配收入为数据展示了一元线性回归模型的散点图分析、模型设定和参数估计过程。读者通过案例操作可系统掌握边际消费倾向的解读、模型显著性检验、结果的口语化转述以及Eviews操作思路。目前已有228人学习适合希望从案例入手理解计量经济学核心流程并提升实操能力的读者。1. 从消费函数到税收模型这份 EViews 案例集能拆出什么网盘里收藏的计量资料十个里有八个是课件和题库真正能从头到尾复现的整套案例反而少见。这份 2021-2022 年被反复保存的精品教学资料正好补上缺口四个完整案例分析把一元回归、截面数据回归、多元回归、过原点回归和 AR(1) 自相关修正全部串了一遍而且每个案例都从经济理论写起而不是从菜单操作写起。EViews 的操作命令在其中只占一小部分更值钱的是为什么这样设定模型的判断。对正在写实证论文的人照着七步建模流程走能避开最常见的错误——数据还没看就先跑回归。对已经熟悉 EViews 的人截距项不显著时的取舍、DW 值偏低时的处理、预测区间的手工验算都是平时不会专门去查的细节。下面按案例推进的顺序逐层拆解涉及的命令都可以直接在 EViews 命令窗口运行菜单路径在 8 到 12 各版本里基本通用。2. 建模七步法消费函数一元回归从理论到估计2.1 为什么建模第一步不是打开软件案例分析一用消费函数讨论计量经济学方法论核心主张是建模按七个步骤走经济理论、数据获得、数学模型设定、计量模型设定、参数估计、假设检验、预测与控制。这个顺序初看繁复但作用是用理论约束建模者的选择。解释变量不是从回归结果里挑出来的而是从理论里推出来的。在消费函数上凯恩斯的绝对收入理论认为家庭消费占收入的比例取决于收入的绝对水平杜森贝的相对收入理论强调消费惯性前期消费水平高会影响下一期的消费水平所以除了当期收入前期消费也应该是解释变量。持久收入理论、生命周期理论则把视角放到更长的时间维度上。这些理论的分歧不在收入与消费是否正相关而在模型里要不要放当期收入之外的变量。2.2 数学模型与计量模型差一个扰动项案例把第三步、第四步分得很清楚。第三步是理论数学模型简单线性形式写成cs β1 β2·inc第四步加上随机扰动项 ut变成计量模型。这一步的关键在于变量的实际定义csCS/Pinc(1-t)·GDP/P其中 P 是以 1978 年为 1 的价格指数tTAX/GDP 是宏观税率。为什么要这样构造变量因为统计年鉴里拿到的是当年价格的国内生产总值和居民消费值不剔除价格因素时间序列回归得到的边际消费倾向会把通胀混进去。用税率修正 GDP 是为了把名义可支配收入近似出来。这个先定义变量再跑回归的习惯在后面的税收模型里同样重要也是复现时最容易被跳过的环节。2.3 两个消费理论对应两组估计结果用最小二乘法估计绝对收入模型得到 cs 414.88 0.51·inc。常数项 414.88 是自发消费即收入为零时仍然存在的消费部分0.51 是边际消费倾向解释为实际可支配收入增加 1 亿元居民消费平均增加 0.51 亿元。改用相对收入理论在解释变量中加入消费的上期值 cs(-1)估计结果发生变化核心参数不再是原来那个 0.51。两个模型的对照关系如下理论模型设定形式常数项边际消费倾向关键点绝对收入假说cs β1 β2·inc u414.880.51收入每增 1 亿元消费平均增 0.51 亿元相对收入假说cs β1 β2·inc β3·cs(-1) u估计值变化估计值明显变化前期消费进入模型MPC 不再稳定两张表放到一起揭示一个事实模型设定不同核心参数估计值会有实质差异。到底选哪个模型取决于后验检验和预测效果而不是哪个结果好看。这是案例分析一留给后面案例的伏笔。2.4 用 EViews 复现消费函数估计以下命令可以直接粘贴到 EViews 的命令窗口逐行执行 创建年度工作文件样本区间 1978-2002 workfile consume 1978 2002 录入原始序列GDP、税收总额 TAX、居民消费 CONS、价格指数 P(19781) data GDP TAX CONS P 构造实际变量居民实际消费 cs、实际可支配收入 inc genr cs CONS/P genr inc (1 - TAX/GDP) * GDP/P 绝对收入假说回归 ls cs c inc 相对收入假说回归加入消费的一阶滞后 ls cs c inc cs(-1)workfile 一行创建年度工作文件并指定样本区间data 一行打开数组窗口逐列录入四个原始序列genr 是 EViews 里生成新序列的标准命令注意 (1-TAX/GDP)*GDP/P 的括号不能省EViews 按表达式优先级先算括号内再算乘法ls 是普通最小二乘估计的快捷键写法是 ls 被解释变量 解释变量列表c 表示截距项cs(-1) 表示消费序列的一阶滞后滞后期数写在括号里。执行完最后一行输出窗口会同时显示两个模型的回归结果对比第 2.3 节表格里的系数即可确认复现是否成功。2.5 从 t 值看边际消费倾向是否可靠输出结果里边际消费倾向估计量的标准误约为 0.01于是 t 统计量 0.51 / 0.01 15。给定显著性水平 5%自由度为 21 时的 t 分布临界值约为 2.0815 远大于临界值所以拒绝总收入系数为 0的原假设认为边际消费倾向显著。这里有个值得养成的习惯看回归输出不要只盯 P 值把系数和标准误拿出来自己除一下。EViews 输出的 t 值就是两者相除的结果复核一遍能顺带发现数据录入或单位是否有问题。这个技巧在后面的多元回归里会再次用到。3. 截面数据回归城市居民消费模型的 EViews 操作链路3.1 为什么用截面数据而不是时间序列案例二的研究对象是各地区居民消费差异。需要注意研究目的是地区间的差异而不是时间上的变化所以选择 2002 年全国 31 个地区的截面数据。被解释变量 Y 是城市居民家庭平均每人全年消费支出解释变量 X 是城市居民人均年可支配收入。之所以限定城市居民是因为各地区城乡人口比例和经济结构差异大直接比较全体居民消费会混入结构因素。同时影响消费的其他因素如居民财产、购物环境不易取得数据零售物价指数、利率在截面数据里地区差异不大这些都被归入随机扰动项。3.2 截面数据工作文件的建法EViews 默认按时间频率建文件但截面数据没有时间维度需要在 Workfile Range 对话框里选 Undated or irregularStart date 填 1End date 填 31。这一步选错频率后面所有操作都会出问题。很多人复现案例时卡在为什么 obs 不是 1 到 31 而是日期多半就是在这里选了 Annual。建完文件后工作框里默认只有 c截距项和 resid剩余项两个对象数据序列需要自己录入。3.3 数据输入与线性关系判断录入数据最直接的方式是在命令窗口执行 打开数组编辑窗口按列录入 Y 和 X data Y Xdata 命令会弹出一个数组编辑窗口第一列是观测序号 obs第二列起按顺序录入即可。也可以在窗口里直接逐个序列粘贴但注意 EViews 对缺失值用 NA 表示空单元格不会自动识别为缺失。录入后先画散点图判断线性关系 以 X 为横轴、Y 为纵轴画散点图 scat X Yscat 是 scatter 的简写第一个参数是横轴变量第二个是纵轴变量。案例中的散点图显示消费和收入大体呈一条从左下到右上的直线这是设定一元线性模型的直接依据。如果散点呈弧形或喇叭形就需要考虑取对数或加权最小二乘直接跑线性回归会失真。3.4 OLS 输出里的三组关键数字在命令窗口执行ls Y C X得到的结果表里需要重点看三组数字统计量数值判读截距项 C282.2434t0.982520不显著不能拒绝其为 0X 的系数0.758511t20.54026显著可支配收入对消费影响明显可决系数 R²0.935685收入解释了消费差异的 93.57%经济意义检验上0.758511 符合边际消费倾向的常识范围即人均可支配收入每相差 1 元消费支出平均相差约 0.76 元。统计检验里截距项 t 值只有 0.98小于临界值 2.045说明截距不显著斜率项 t 值 20.54远大于临界值拒绝收入对消费无影响的原假设。R² 达到 0.9357意味着模型整体拟合很好。注意这里的临界值 t0.025(29)2.045自由度是 31 减 2与第 2.5 节时间序列案例的自由度来源不同查表时要对应各自的样本量。3.5 扩展样本范围做预测案例用估计出的模型预测西部地区城市居民人均收入达到 8270 元1000 美元和 12405 元1500 美元时的消费支出。操作分两步先把工作文件范围从 31 扩展到 33再输入新的 X 值并执行预测 把范围和样本区间扩展到 33 range 1 33 smpl 1 33 在 X 序列的 32、33 位置录入 8270 和 12405 data X 打开回归方程窗口执行预测生成预测序列 YF forecast YFrange 命令改变工作文件的总范围smpl 改变当前样本区间两者必须同时调整只改 range 不改 smpl 会导致预测时样本区间仍停在 1 到 31。forecast 执行后双击工作框里的 YF 序列第 32、33 行的值就是点预测6555.13 和 9691.58。区间预测需要手工计算用表 2.7 的描述统计结果代入预测区间公式Xf8270 时 Y 平均值 95% 置信区间为6393.036717.23个别值区间为5694.817415.45Xf12405 时分别对应9292.3310090.83和8757.0910626.07。个别值区间比平均值区间宽因为多了一个个体随机波动项很多初学者只看平均值区间而误用了窄区间在论文里会被审稿人挑出来。4. 多元回归与变量筛选税收增长模型中的系数解读4.1 三个解释变量是怎么定下来的税收增长案例研究的是中国税收收入增长的原因和规律样本区间 1978 年到 2002 年。备选因素有四个经济整体增长、公共财政需求、物价水平、税收政策。最终进入模型的解释变量是 GDPX2、财政支出X3、商品零售物价指数X4。税制改革虽然重要但 1985 年利改税导致当年税收陡增 215.42%属于难以量化的外生冲击且 1985 年后税制改革对税收增速的影响不算太大案例选择暂不考虑。这个变量筛选逻辑在实证论文里很常见先从理论列出候选因素再把不可量化或与其他变量高度相关的因素剔除。财政支出代表公共财政需求公共财政需求越强税收征收的动机越强零售物价指数代表物价水平我国的税制结构以流转税为主按现价计算的 GDP 和经营收入都受物价影响。被解释变量选各项税收而非税收总收入是为了口径统一。4.2 数据录入与多元回归命令多元回归的录入方式与一元回归完全一致只是变量多一些 建立年度工作文件样本 1978-2002 workfile tax 1978 2002 录入被解释变量和三个解释变量 data Y X2 X3 X4 查看解释变量两两相关程度预判多重共线性 cor X2 X3 X4 最小二乘估计 ls Y C X2 X3 X4cor 命令输出的是解释变量的相关矩阵这一步在多元回归里建议养成习惯先跑一遍。如果两个解释变量的相关系数超过 0.8就要警惕多重共线性。本例中 GDP 和财政支出都是逐年快速增长的宏观总量相关程度相当高这也是后面解读系数时要特别小心的地方。4.3 系数解释与统计检验估计结果为Y -2582.791 0.022067·X2 0.702104·X3 23.98541·X4变量系数经济含义截距 C-2582.791无直接经济含义回归线在样本范围外的截距X2 国内生产总值0.022067GDP 每增加 1 亿元税收收入平均增加约 0.022 亿元X3 财政支出0.702104财政支出每增加 1 亿元税收收入平均增加约 0.70 亿元X4 商品零售价格指数23.98541物价指数每上升 1 个百分点税收收入平均增加约 24 亿元三个解释变量的符号都符合理论预期。X3 的系数接近 0.7说明在这个样本期内公共财政需求对税收的拉动作用最明显。X4 的系数看起来很大是因为解释变量的单位不同——物价指数是百分数点而 X2、X3 以亿元计单位不一致时系数绝对值不能直接比较大小这是初学者最容易误读的地方。统计检验上模型整体的 F 检验和单个系数的 t 检验结果都显著但结合 4.2 节的相关矩阵GDP 与财政支出高度相关单个系数的标准误可能被放大结论宜谨慎表述。4.3.1 多重共线性的进一步判断如果相关矩阵显示 X2 与 X3 相关系数很高可以继续看辅助回归把 X2 对 X3、X4 回归计算 VIF。VIF 大于 10 通常认为共线性严重。EViews 里没有直接的 VIF 命令做法是分别跑辅助回归用 1/(1-R²) 手算。案例本身没有给出这一步但作为多元回归的常规检查建议在复现时补上。若确认共线性严重常见做法是删变量、改用对数形式或做差分而案例的样本只有 25 年删变量会损失解释力所以保留三个变量的设定在教学中是可以接受的。5. 过原点回归与自相关修正AR(1) 处理的完整路径5.1 相对指标把绝对量变成比值建筑业工资案例研究的是行业工资差异是否由行业垄断程度引致。变量构造有两个关键点工资水平用建筑业平均工资 / 全社会平均工资垄断程度用建筑业国有化程度 / 全社会国有化程度。之所以不用绝对价格是因为研究的关注点是行业相对位置的变化要剔除全社会平均工资的整体上涨趋势。国有化程度在这里作为垄断程度的代理指标理由是转型期的行业垄断更多体现为国有经济对行业的控制程度而不是西方产业组织理论里用前几家大厂商份额度量的市场垄断。数据取自《中国统计年鉴》1978 年到 2002 年间的 17 个年份。5.2 截距项不显著时的取舍先用带截距的模型回归得到建筑业相对国有化程度 X 的系数为 1.311088t 值 8.690069显著但截距项 C2.939984t 值只有 0.249528完全不显著。截距不显著意味着什么说明当相对垄断程度接近 0 时建筑业的相对工资水平也没有显著偏离 0回归直线倾向于通过原点。此时有两种选择保留截距项接受一个不显著的常数或者去掉截距项改估过原点回归。案例选择后者因为去掉截距后模型的修正可决系数从 0.823238 提高到 0.833598拟合优度改善。5.3 三个模型的对照模型X 的系数t 值截距 t 值调整 R²DW 值带截距1.3110888.6900690.2495280.8232380.930656过原点1.348582102.2770—0.8335980.951702过原点 AR(1)1.36013465.24616—0.8811901.931114第一个表里 X 系数 t 值只有 8.69第二个表里去掉截距后 t 值暴涨到 102.28这是因为系数标准误的计算方式在无截距模型里发生了变化并不代表经济意义变了。真正需要盯住的是 DW 值0.951702 明显小于 2说明误差项存在正自相关。此时系数估计虽然仍是无偏的但标准误被低估t 检验和 F 检验都不可靠必须修正。5.4 AR(1) 修正的两行命令在 EViews 里引入一阶自回归误差项只需在解释变量列表末尾加上 AR(1) 过原点回归不带截距项 ls Y X 引入 AR(1) 修正误差项自相关 ls Y X AR(1)AR(1) 不是解释变量它告诉 EViews 误差项服从 ut ρ·ut-1 εt 的一阶自回归结构软件会用迭代法同时估计回归系数和自回归系数。输出结果里多出一行 AR(1) 的估计值 0.426743t 值 2.046683在 10% 显著性水平下显著关键是 DW 值从 0.951702 提升到 1.931114非常接近 2 的理想水平正自相关得到修正。同时调整 R² 从 0.833598 提高到 0.881190模型的解释能力也改善了。这里有一个容易混淆的点AR(1) 处理的是误差项的自相关不是把被解释变量的滞后项加进方程。如果混淆了这两个概念会在模型里同时放 Y 的滞后项和 AR 项造成重复设定。判断依据是看 DW 值——它检验的就是误差项的一阶自相关AR(1) 是直接对症的措施。输出末尾的 Inverted AR Roots 显示 0.43绝对值小于 1说明自回归过程是平稳的修正有效。6. 复现这套案例时必须注意的细节6.1 用 t 值和标准误互相验证EViews 输出的 t 统计量在数值上等于系数除以标准误。第 3 章里 X 的系数 0.758511 除以标准误 0.036928得到 20.54026与输出一致。第 2 章里边际消费倾向 0.51 除以 0.01 得到 15与报告值一致。复现时如果这两个数对不上优先检查数据是否录入错位、样本区间是否被 smpl 改动过。常见的错误是录数据时漏掉一行导致序列整体错位回归结果里 t 值会出现奇怪的跳变。6.2 样本范围调整与预测验证案例分析一提到用 1978 到 1999 年的数据重新估计再用 2000 到 2002 年的数据做检验。实际操作是 缩样本重新估计 smpl 1978 1999 ls cs c inc 恢复全样本生成预测序列并对比实际值 smpl 1978 2002 forecast csf genr err cs - csfsmpl 改变的是当前使用的样本区间ls 重新估计后方程对象只基于缩小的样本此时 forecast 生成的序列名不要与已有序列重名否则 EViews 会提示覆盖。genr err 生成残差序列把 err 画出来就能直观看到 2000 到 2002 年这三年的预测偏差。对比时注意预测值是基于 1999 年以前的系数外推的如果 err 在这几年里系统性偏离 0说明模型结构在这段时间发生了变化。6.3 版本差异、NA 与单位陷阱网上搜 EViews 安装教程时往往只讲到装完、激活、打开主界面真正卡住人的是装完之后的第一步操作。EViews 8、9、10、12 的菜单名称略有差异例如较新版本把 Time series 等频率选项做得更细但命令窗口的语法基本通用workfile、ls、genr、data 这些核心命令从 6 到 12 都能直接运行所以复现这套案例时优先用命令窗口而不是菜单可以绕开版本差异。数据层面的坑有三个一是缺失值必须用 NA 填充不能留空否则 data 窗口会把空格当作 0二是截面数据的 obs 编号只是顺序号没有时间含义做滞后操作前先确认工作文件频率三是单位问题案例里既有亿元也有元既有指数也有百分数点回归系数会随单位变化而数量级不同解释时必须回到原始单位。把这三条写进检查清单再配合 6.1 的 t 值复核这套案例的复现基本不会跑偏。本文还有配套的精品资源点击获取
返回列表