
本系列将 “宏观经济” 相关的课题研究脱敏处理整体重点围绕水平测度、差异来源识别与机制拆解做全流程解析与优化并按照实际研究顺序、工作梳理笔记代码编写成比较普适的版本在文章及绑定资源中展现需要的读者可自行复制、下载。另外文章内容、研究逻辑、代码示例等仅供参考欢迎大家参与讨论 / 咨询问题。如发现错误也可及时提醒以便查证、勘误。本篇为 Python 宏观经济实证系列先导总结了实际研究中前期检索、采集的经验要点文章框架与技术路线的搭建示例帮助读者快速建立研究框架为后续代码实战做好铺垫。一、定题与信息检索首先我们需要确定研究方向大方向定为 “宏观经济”小方向按照自身需要确定这里我们拟定为Economy_1。其次确定研究Economy_1的什么研究什么地区Where、什么时间段Time的Economy_1那么定题为《WhereEconomy_1水平的空间结构差异与内在影响因素分析》。最后根据 “定题” 进行信息检索也就是列出问题清单并寻找答案问题对应节点1.Economy_1定义是什么研究背景2.Economy_1在什么时间、地点、场景产生3.Economy_1的发展历程是什么1. 有关Economy_1的理论来源有哪些分别都讲了什么理论支撑1.Economy_1水平是什么指标体系构建2.Economy_1水平怎么衡量 / 测度可以分成哪些维度1. 关于Economy_1水平的衡量 / 测度有哪些相关案例、文献、结果成熟、缺失的方向分别有哪些文献综述技术路线水平测度参考文献2. 关于Economy_1水平的衡量 / 测度一般都用哪些方法或者相关 / 同类别研究一般采用什么方法3.Economy_1水平在 “同一时间、不同地区” 和 “同一地区、不同时间” 会有所差异。那么差异的现状是什么现状反映了什么4.Economy_1水平的发展规律是什么发展规律反映了什么1.Economy_1水平的差异来源是什么研究差异来源的方法有哪些相关文献、结果有哪些成熟、缺失的方向分别有哪些文献综述技术路线空间结构、时序差异参考文献2.Economy_1水平的差异来源是否有规律如果有差异来源的规律反映了什么1. 影响Economy_1水平的主要因素是什么判断主要因素的方法有哪些相关文献、结果有哪些成熟、缺失的方向分别有哪些文献综述技术路线因素判断、机制分析参考文献2. 影响Economy_1水平的因素与结果之间的关系是什么是否存在传导机制1. 根据水平测度结果、差异来源分析、规律总结、传导机制分析我们能够得到哪些结论结论与建议2. 对应的优势、缺陷有哪些3. 是否能够给出合理的的发展建议补充是否能够基于现状与不同的发展方向对Economy_1进行预测这一步结束后我们就可以得到初步的研究背景与意义、文献综述、理论支撑、指标体系、技术路线、参考文献。二、逻辑拆解 - 技术路线由第一部分我们找到了许多参考文献与方法再结合自身掌握的理论知识与经验我们就可以梳理怎样对《WhereEconomy_1水平的空间结构差异与内在影响因素分析》展开研究整理出技术路线最好用流程图的形式展现出来如果有必要可以再附上文字图解。本质目的就是展现清晰的逻辑。我们就按照研究的步骤每一个步骤需要投入什么、会产出什么步骤与步骤之间的关系梳理的一份流程图供大家参考三、数据采集、指标微调第一部分大概知道了衡量Economy_1水平的维度。那么这一步就是需要细分与完善并获取相应数据。总结一些需要注意的要点以及能提升效率的办法1.避免遗漏 可以先将指标体系列成表格每找完一个都作标注比如已找全、什么部分缺失、找不到的情况下替换成了什么2. 避免统计口径不同每个指标的数据来源尽量为同一官方渠道比如同一年鉴、公报、期刊、数据集等3. 选的指标尽量是能够直接找到数据的如果需要不同数据之间作四则运算产生的指标也需要将计算公式提前确定、记录在指标体系的表格中4.避免人工输入失误录入数据时可以分开两个窗口一个窗口是原件一个窗口是存储数据的文件因为大多数官方下载下来的表格 / 官网能看到的数据都不支持直接在原件上作操作这样能够实时核对避免窜行以及复制粘贴比较方便5.避免人工输入失误尽量能找到数据比较全的表格比如某个指标 XX ~ XX 年的数据在同一个表格中就能找到这样可以大块复制粘贴减少工作量6.避免人工输入失误合理、合规的情况下可以用 Python 爬虫爬取、存储7.避免人工输入失误可以分类别开分表存储大量数据容易看窜行分类存储方便录入、检查最后处理分析数据时如果想一次性批量处理再合并成同一个表格8.数据、文件留存每阶段、每个任务的数据来源都要标注文件能下载就下载并存储避免发现错误时无法溯源。本篇文章作为先导希望能在研究的准备阶段和框架部分对大家有所帮助欢迎讨论与交流从下一篇开始正式进入 Python 实战部分所用工具为Jupyter Notebook。