AI时代,那些藏在安全背后的数学理论

发布时间:2026/7/22 14:44:49

AI时代,那些藏在安全背后的数学理论 当AI还只是生成文字、图片和代码时一次出错不过是回答不准、图片跑偏、代码返工。但当AI开始能发邮件、改数据库、批订单、调资金、控制设备它就从回答问题的模型变成了把判断变成现实的执行系统。这中间的差别不是量的而是质的。前者的错误可以被撤销、重来、修补后者的错误会沉淀成一笔转账、一条删除的记录、一个已经合上的电闸。一旦落地很多结果没有再生成一次的选项。我们却仍习惯用同一套指标给这两类系统打分——正确率99%、99.9%、99.99%每多一个9仿佛就离可信更近一步。但安全领域最容易被忽略的一句话是正确率描述系统通常表现如何却没告诉你它最坏能错到哪里。下面七个数学视角藏着AI执行安全真正的分水岭。它们不复杂用的都是中学数学却常常在最关键的决策上被绕过去。1. 正确率把所有错误压成了同一个数字一个系统执行一万次9999次对、1次错正确率99.99%。报表上堪称优秀。但那一次错是什么错分一封邮件几乎无害误删生产数据、批一笔无法追回的转账、启动高风险设备操作评价则完全不同。问题在于正确率只数次数。统计表里分错邮件是1转错巨款也是1。可现实中的错误从不等价。衡量安全更接近现实的是风险等于概率乘以损失这条基本公式风险 发生概率 × 可能损失一个错误很少发生不代表它不重要。假设某类事故概率只有万分之一每次却损失一亿元把它代入公式风险依然是一万元不能被当作几乎为零随手抹掉。更麻烦的是这类损失往往不能用平均值消化。企业也许能承受每年稳定损失一万元却未必扛得住某天突然损失一亿。前者是可以摊进预算的成本后者可能直接决定企业还在不在。数学上的期望值假设你能反复经历很多次、让好运和坏运相互抵消但对一家公司来说最坏的那一次如果足够坏就没有下一次来平摊了。安全评估要看的从来不只是期望值还有那条最坏情况的尾巴有多长。智能系统追求提高做对的比例安全系统关心限制做错的代价。2. 一万次没出事不等于风险为零另一种常见说法是系统跑了一万次从没出严重问题。很有说服力但它只证明过去一万次没出事证明不了概率为零。用一次都不出事的概率这个公式可以算笔账一次都不出事的概率 (1 − p)^n其中 p 是单次事故概率n 是测试次数。若 p 是十万分之一、n 是一万代入后约等于90%。也就是说即便系统真藏着十万分之一的风险跑一万次仍有约九成可能什么都看不见。它未必通过了考验只是还没遇到那道考题。这也是很多重大事故发生前系统长期稳定运行的原因风险不是在事故当天才诞生的它可能一直存在只是过去的样本还没触发它。没观察到风险是一种观测结果风险不存在是一个强得多的结论。3. 越罕见的事故代价往往越大频繁的小问题容易被看见页面每天卡十次用户会投诉报表会记录问题越频繁越容易进入工作计划。真正危险的风险常常相反——几年一遇甚至一家公司整个周期都没发生过可一旦发生一次抵得上所有日常小错之和。同样用概率乘以损失对比两类问题问题A概率 1% × 损失 100 元 平均风险 1 元 问题B概率 0.001% × 损失 1000 万元 平均风险 100 元A更常见B几乎看不见但B的平均风险是A的一百倍。而且B一旦发生带来的不是平均100元是实打实的1000万。错误也从不均匀分布。假设系统每年十万次任务99%是普通操作错误率0.01%1%是紧急操作错误率5%普通操作约出10次错紧急操作只有一千次却出约50次错。整体正确率仍高达99.94%可占业务量1%的紧急操作制造了超过80%的错误。这就像一条平均一米深的河大部分地方半米中间却有个五米深的坑。平均值没撒谎它只是把最危险的部分藏了起来。修堤坝的工程师从不按河流的平均水位设计决定堤坝高度的永远是几十年甚至百年一遇的极端水位。AI执行系统也一样普通任务里的小错决定用户体验极端场景里的一次错却可能决定企业还能不能继续存在。所以安全评估不能只问平均错误率是多少还要追问高金额操作、紧急模式、陌生地址、跨境转账、权限恢复、数据缺失、多规则冲突时错误率各是多少。总体表现优秀证明不了每一个局部场景都安全。事故不会公平落在每一次操作上它总聚集在系统最难处理、后果最严重的角落。4. 三个人同意可能只是同一个错误重复了三次为降低个人误判企业惯用多人审批。逻辑没错但前提是判断足够独立。用多数表决下至少两人同时出错的概率来看三个独立审批者各有10%错误率、多数通过至少两人同错的概率约2.8%远低于单人的10%。这正是多人决策能提高可靠性的数学基础。可现实中的审批往往不独立三个人看同一份摘要、依赖同一个AI风险评分、引用同一个数据库。若系统自动生成的摘要写着常规数据库优化预计无业务影响三位负责人看的都是这句话都没查实际命令于是都点了同意。流程上是三人共审信息结构上只是同一份错误摘要被确认了三次。人数增加了独立信息却没有增加。增加审批层同理。第二道防线是否有价值取决于它能否在第一道失败后发现新问题。用剩余风险等于漏检率乘以未识别比例估算第一道漏检 5%第二道独立且识别 80% → 剩余风险 5% × (1 − 80%) 1% 第二道只看同一份摘要、仅识别 5% → 剩余风险 5% × (1 − 5%) 4.75%同样两层流程前者把风险降到1%后者几乎原地踏步。组织付出了更多时间、生成了更多日志真实安全能力却没变。审批的价值不在页面上多了一个名字而在于它是否带来新的事实、新的验证方式和新的拒绝能力。真正降低风险的不是多一个人点击而是多一个独立的信息来源。5. AI的90%确定不是现实中的90%安全当AI说我有90%把握人们容易听成这件事90%安全。但置信度只是模型对自身判断的评分不是现实开出的担保书。一个校准良好的模型给90%置信度的判断里约九成正确可现实中的模型可能给90%时实际只对70%甚至在从没见过的场景里依旧自信。模型最危险的状态不是承认不知道而是不知道自己不知道。即便置信度完全准确它也只覆盖模型看到的那部分。真实执行还依赖输入是否真实、数据是否完整、审批是否被误导、策略是否过期、设备是否正常。用串联系统整体可靠度等于各环节可靠度相乘这条公式来看假设一条链五个环节各99%可靠整体可靠度 99% × 99% × 99% × 99% × 99% ≈ 95.1%每一环单看都优秀组合后只剩约95.1%。不是哪一环突然变差而是串联结构会把每一环的不确定性乘在一起、层层累积。环节越多这种衰减越明显——十个99%的环节串起来整体可靠度就跌到约90%。这也解释了一个反直觉的现象把系统拆得越细、加的检查越多如果这些环节是串联的、必须全部正确整条链反而更脆弱。模型可以有90%的把握但模型有多少把握和这项操作能否被安全执行始终是两个不同的问题。置信度是模型对自己的评价不是现实对模型的承诺。6. 为什么最后一道边界反而应该更笨如果正确率覆盖不了严重后果、历史数据证明不了零风险、多人审批可能共享同一错误、模型置信度也代表不了全链路安全那现实执行最终该靠什么答案有点反直觉最后一道边界不需要比AI更聪明它应该更简单、更保守。AI要理解复杂世界——读文件、判意图、处理例外、在不完整信息里给出最可能的答案。最后一道边界不需要理解世界它只需记住少数绝不能被突破的条件。用一个所有条件相乘的判定公式表达执行 A × T × W × Q × S 其中金额未超限 A、目标在允许范围 T、时间在许可窗口 W、授权人数达标 Q、设备状态正常 S 每项满足记 1不满足记 0任何一项为0结果就是0即拒绝执行。它不懂情况紧急不会被一个充分的理由或一段宏大叙事说服只检查条件是否满足——这正是它的价值。越聪明、越灵活的系统越擅长为例外找理由而最后一道边界要做的恰恰不是理解例外而是拒绝例外。AI可以建议向一个新地址转移资产边界只需检查这个地址是否经过必要的等待与验证AI可以判断某项操作非常紧急边界只需检查紧急状态下是否仍满足金额、授权和设备条件。AI负责处理开放世界的复杂性边界负责守住封闭世界的底线。AI需要理解整个世界边界只需要记住哪些事情绝不能发生。7. 从提高正确率到限制错误的距离过去的软件主要追求效率更快、更准、更自动就意味着更高的生产力。AI时代没有改变这一点却增加了一个新问题——当一个概率系统拥有了现实执行能力错误就不再停留在屏幕上。一句错话可以重说一笔完成的转账可能无法撤回一个错误建议可以修改一次已经发生的物理动作却没有第二次机会。所以AI安全不能只问怎样让模型少犯错。模型该更准、数据该更可靠、测试该更全面、审批该更有效但这些主要解决的仍是降低出错概率。执行安全还必须回答另一个问题一旦错误真的发生它能走多远能否越过审批、拿到签名、改动关键系统把一个概率性的判断直接变成不可逆的现实这两件事都重要但不是同一件事。前者是把出错的概率往下压后者是给已经发生的错误装上刹车和护栏限制它能造成多大的破坏。一个只优化正确率的系统是在赌坏事永远不发生一个真正安全的系统是在假设坏事迟早会发生的前提下仍然让后果可控、可撤回、可承受。成熟的系统不会把希望全押在错误永不出现。它承认模型会误判、数据会污染、人会疲劳、审批会被诱导、规则会过期、设备会异常然后在所有不确定性之后仍保留一道简单、清晰、独立、能够说不的边界。这道边界不追求聪明只追求可靠它不参与判断该不该做只负责守住绝对不能做的那条线。统计学研究不确定性如何出现安全工程研究的是不确定性抵达现实之前如何被拦住。最终我们需要记住的也许只有一句话概率可以参与判断但不能独自拥有执行权。

相关新闻