尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI 预测不能直接当真值:如何用少量人工标注改进统计推断?——从 PPI 到 RePPI

AI 预测不能直接当真值:如何用少量人工标注改进统计推断?——从 PPI 到 RePPI 温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。作者舒清扬 (连享会)邮箱lianxhcn163.comTitle: AI 预测不能直接当真值如何用少量人工标注改进统计推断——从 PPI 到 RePPIKeywords: 预测驱动推断, PPI, RePPI, 人工标注, 替代指标, 交叉拟合, 统计效率提要LLM 可以低成本为成千上万份年报、电话会议记录或政策文本生成评分但这些 AI 预测值并不等于真实结果变量直接把它们放进回归可能改变研究者真正要估计的参数。完全不用这些预测值又会浪费其中包含的大量信息。Prediction-Powered Inference (PPI) 提供了一种解决方案用少量人工标注获得金标准结果同时利用大规模低成本预测提高统计效率。Ji、Lei 和 Zrnic (2026) 提出的 RePPI 又进一步利用人工标注样本学习 AI 预测误差的系统结构对 prediction 进行再校准。本文从这一研究场景出发介绍 PPI 与 RePPI 的基本原理、三折交叉拟合、Python 实现和模拟结果并讨论人工标注样本的设计、有限样本表现以及实际使用边界。代码与材料作者研究代码Wenlong2000/RePPI基础 PPI Python 软件包aangelopoulos/ppi_py本文配套代码下载 ZIP浏览源代码及说明lianxhcn/lianxh_blog完整推文材料下载完整材料1. 一个现实问题AI 可以大规模预测但不能直接当真值现在越来越多的实证研究开始使用 LLM 或其他预训练模型批量生成文本评分。真正困难的问题已经不再是 AI 能不能把 10,000 份文本都标出来而是这些低成本生成的预测值能不能直接作为数据使用。如果不能研究者又该怎样利用少量人工标注把其中有价值的信息带入正式的统计推断PPI 和 RePPI 处理的就是这类问题。它们面对的是一种很具体的数据结构真实结果变量的获取成本较高因此只能观察少量模型预测的边际成本较低可以覆盖大样本。研究者希望把两类数据结合起来同时满足两个要求最终要估计的参数仍然由真实结果变量定义又尽可能利用大规模预测值中包含的信息来提高统计效率。1.1 我有 10,000 份文本能用人工标多少假设我们想研究企业管理层的风险认知。手头有 10,000 份年报真正想使用的变量 YiYi​ 是研究助理阅读全文后根据统一标准给出的风险认知评分。人工阅读和复核可以形成相对可信的金标准结果但如果 10,000 份年报全部依靠人工处理成本会很高。LLM 改变了这个约束。只要设计好提示词和评分规则就可以让模型处理全部年报得到Y^1,Y^2,…,Y^10000.Y^1​,Y^2​,…,Y^10000​.研究者此时大致有三种做法。第一种是认真标注 300 或 500 份只用这些真实 YY 做回归第二种是让 LLM 标完 10,000 份并直接把 Y^Y^ 当成 YY 做回归第三种是把 10,000 份全部人工标注。第三种方案通常成本太高因此实际需要权衡的是前两种。只用人工标签时统计目标没有改变但样本量可能只有几百个估计精度有限。直接使用 10,000 个 AI prediction 时样本量大幅增加表面上看标准误会明显下降但此时需要先确认一件事回归中使用的变量已经由真实 YY 变成了模型生成的 Y^Y^研究对象可能因此发生变化。1.2 直接把 AI prediction 当成 YY到底改变了什么假设研究目标是总体中的 OLS projectionβ∗arg⁡min⁡βE[(Y−X′β)2].β∗argβmin​E[(Y−X′β)2].这个参数描述的是目标总体中真实结果变量 YY 与 XX 之间的线性关系。如果把 AI 生成的 Y^Y^ 直接放在回归左边估计的则是βY^∗arg⁡min⁡βE[(Y^−X′β)2].βY^∗​argβmin​E[(Y^−X′β)2].后一个参数描述的是模型预测值 Y^Y^ 与 XX 之间的关系。只有在比较特殊的条件下βY^∗βY^∗​ 才会等于 β∗β∗。例如人工评分范围是 0–100而 LLM 对极端值存在系统性的向均值收缩。人工打 95 分的文本模型经常给 85 分人工打 20 分的文本模型经常给 30 分。又比如模型在科技企业年报上的预测误差较小但对金融企业系统性高估风险或者真实人工评价是连续变量而模型为了输出稳定只给出 1–5 五个等级。这些情况下Y^Y^ 仍然可能与 YY 高度相关却不能被视为 YY 的无误差复制品。因此人工抽查发现准确率达到 90%或者人工评分与模型评分之间的相关系数达到 0.9都不足以推出βY^∗β∗.βY^∗​β∗.这也是 AI 预测值进入回归时最容易被忽略的问题。1.3 少量人工真值与大量 AI 预测如何结合问题的关键并不是在人工标注与 AI prediction 之间二选一。人工标签的优势是可信但成本高、样本小AI prediction 的优势是便宜、覆盖范围大但可能存在系统误差。PPI 的目标是在参数仍然由真实 outcome 定义的前提下利用大量低成本 prediction 提高统计推断效率。这里人工标注的角色需要特别说明。少量人工标注并不是简单用来检查 AI 准不准而是提供 gold-standard outcomes。它们一方面决定研究者真正要估计的对象另一方面也为 AI prediction 的统计校正提供依据。图注大量样本只有 XX 和 AI 替代指标 Y^Y^少量样本同时拥有真实 YY。直接用 Y^Y^ 替代 YY 会改变目标参数PPI 和 RePPI 利用人工标注样本把推断目标锚定在真实 YY 上同时利用大规模预测值提高信息利用效率。本文讨论的是 AI 对结果变量 YY 的预测或替代指标。严格来说Y^Y^ 并不是一个由 AI 创造出来的真实结果变量而是对真实 YY 的 prediction 或 surrogate。如果模型生成的是解释变量、处理变量或控制变量问题会转化为插补协变量和测量误差第 5 节会再讨论这一点。温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。
返回列表