Havenlon|AI 时代的执行安全语言体系(六二):失败模式

发布时间:2026/7/28 13:00:15

Havenlon|AI 时代的执行安全语言体系(六二):失败模式 Working Draft · AI Era Execution Security LanguageThis article is part of the Havenlon Execution Security Language project.The terminology and definitions presented here describe the currentworking draft and may evolve as the discipline matures.AI 时代执行安全语言体系工作草案本系列旨在建立 AI 时代执行安全的共同语言。本文中的术语与定义代表当前工作草案将随着理论研究、工程实践和社区讨论持续修订任何复杂系统都会失败。设备会掉电网络会中断Policy 会过期审批状态会不同步SaaS 会不可用存储会耗尽硬件会损坏管理员会误操作AI Agent 会产生错误判断外部执行系统也可能返回模糊结果。因此真正重要的问题不是系统会不会失败而是系统失败时会变成什么状态传统系统经常把“可用性”置于最高优先级。当某个安全检查不可用时它们可能选择跳过检查使用缓存结果沿用旧 Policy自动切换到备用路径暂时关闭审计放宽额度改用管理员直连默认继续执行。这些机制短期内看起来提高了可用性却可能把一个局部故障升级为灾难性执行。Havenlon 不追求“任何情况下都继续运行”。它要求系统明确区分哪些能力可以继续哪些能力必须缩小哪些动作必须暂停哪些状态需要物理恢复哪些故障可以自动恢复哪些故障必须进入治理哪些未知状态必须默认拒绝哪些恢复路径不能成为绕过安全边界的后门。Havenlon 对安全失败的核心定义是安全失败不是系统停止工作而是系统在失去完整判断能力时主动收缩到最小风险状态。因此失败模式设计的目标不是“永不失败”而是失败必须可识别失败不能静默扩大局部失败不能自动传播不确定状态不能被解释为允许高风险能力必须优先收缩低风险、可逆能力可以受控保留恢复过程必须受到独立治理失败、降级、锁定和恢复都必须留下证据安全状态不能由上游普通管理员随意解除所有失败状态都必须有明确进入条件、允许能力和退出条件。1. Failure Mode失败模式一句话定义失败模式是系统、组件或执行链在发生故障、失陷、异常或资源不足时表现出的具体状态与行为方式。严格定义Failure Mode 不只是“哪里坏了”。它必须描述失败发生在哪一层失败由什么触发哪些状态仍可信哪些能力仍可用哪些动作必须停止是否可能产生部分结果是否会传播到其他组件是否需要人工或物理恢复是否形成证据是否允许自动退出。典型失败模式包括安全失败不安全失败静默失败部分失败级联失效共因失效模糊执行状态背压状态降级运行锁定状态。上位概念System StateFailure BehaviorResilience下位概念Safe FailureUnsafe FailureSilent FailurePartial FailureCascading FailureCommon-Mode Failure相关概念Safe ModeFail-SecureControlled DegradationRecovery BoundaryBlast Radius容易混淆的概念故障类型回答什么东西出了问题失败模式回答出问题以后系统如何表现同一个网络故障可以导致安全暂停使用缓存继续自动切换旁路静默丢失证据。这些是完全不同的失败模式。约束机制失败分类状态机明确触发条件受限能力表默认拒绝故障证据恢复条件。结果目标让系统在异常发生后进入预定义、可审计、风险有限的状态而不是临时 improvisation。在 Havenlon 中每类设备、Policy、证据、治理和通信异常都必须映射到明确系统状态。2. Safe Failure安全失败一句话定义安全失败是系统发生异常后主动限制、暂停或拒绝高风险执行使故障不能继续扩大真实损失的失败模式。严格定义安全失败通常表现为不生成签名不形成 Commit不触发 Executor降低额度限制频率禁用自动化只允许只读访问保留诊断能力进入 Safe Mode要求治理或物理恢复。Safe Failure 不等于所有功能停止。它的核心是在系统无法证明安全条件仍然成立时不继续授予不可逆执行能力。上位概念Failure ModeFail-Secure下位概念Execution Safe FailureEvidence Safe FailureGovernance Safe FailureCommunication Safe FailureDevice Safe Failure相关概念Fail-ClosedDeny by DefaultRestricted ModeLeast Harmful FailureSafe Interruption权力边界安全失败状态不能被上游简单标记为“忽略错误后继续”。约束机制默认拒绝本地最终否决能力收缩状态持久化故障证据受控恢复。结果目标将组件故障从潜在灾难转化为可管理的服务中断或有限降级。在 Havenlon 中Intent、Policy、证据链或本地状态无法验证时系统优先拒绝高风险执行。3. Unsafe Failure不安全失败一句话定义不安全失败是系统发生异常后仍继续执行、扩大权限或失去约束从而增加真实损失可能性的失败模式。严格定义典型不安全失败包括Policy 服务不可用时默认允许审批状态无法获取时沿用旧允许Evidence Store 已满时停止留证但继续执行Arbiter 异常时应用直连 Executor安全芯片失败时使用软件备用密钥本地设备离线时改由 SaaS 直接执行设备状态不明时自动重试恢复模式关闭全部限制。不安全失败通常源于把业务连续性放在执行边界之上。上位概念Failure ModeExecution Risk下位概念Fail-OpenBypass-on-FailureUnverified ContinuationUnsafe Degradation相关概念Boundary BypassCatastrophic ExecutionSilent FailureCascading FailureUnsafe Recovery权力边界任何组件都不能以“保证业务不中断”为由单方面取消关键执行约束。约束机制禁止 fail-open故障路径审计备用路径同等治理本地硬限制恢复路径约束安全状态测试。结果目标识别并消除那些在正常状态安全、故障状态却自动放宽约束的设计。在 Havenlon 中SaaS、网络或 Policy 不可用时系统不会自动切换成无治理执行。4. Silent Failure静默失败一句话定义静默失败是组件已经发生异常或未完成预期行为但系统没有明确暴露、记录或传播这一状态的失败模式。严格定义Silent Failure 可能表现为证据写入失败但执行仍标记成功Policy 拉取失败却使用空值审批同步失败但 UI 显示已通过counter 未持久化但系统继续运行Executor 部分失败但返回通用成功设备进入异常状态但未告警Receipt 丢失却自动标记已完成备用路径被启用但未记录。静默失败危险之处在于系统的真实状态与对外显示状态开始分离。上位概念Failure ModeObservability Failure下位概念Silent Evidence FailureSilent Policy FailureSilent Execution FailureSilent State DivergenceSilent Recovery Failure相关概念Evidence GapHidden DegradationState DivergenceAudit FailureAmbiguous Execution State权力边界组件不能将无法确认的状态静默转换为成功或允许。约束机制明确错误传播状态一致性检查失败强制留证告警未知状态类型禁止自动掩盖。结果目标让失败变得可见、可定位和可约束防止风险在“看起来正常”的状态下继续积累。在 Havenlon 中证据、Policy、治理或 Executor 状态无法确认时必须显式进入异常状态。5. Partial Failure部分失败一句话定义部分失败是执行链、系统或复合动作中的一部分成功而另一部分失败或状态未知的失败模式。严格定义部分失败可能出现在Commit 已形成但 Executor 调用失败多个子动作中部分成功交易已签名但未广播请求已广播但 Receipt 未返回治理变更部分同步多设备中部分完成状态更新Evidence 已写入本地但未完成归档恢复流程完成身份替换但未完成旧状态撤销。部分失败必须明确哪些步骤已不可逆哪些步骤可以重试哪些动作需要补偿是否可能产生重复结果是否需要冻结后续动作当前灾难半径是多少。上位概念Failure ModeDistributed Execution Failure下位概念Partial Commit FailurePartial Execution FailurePartial Governance FailurePartial Evidence FailurePartial Recovery Failure相关概念Ambiguous Execution StateCompensationIdempotencySafe InterruptionResult Reconciliation权力边界系统不能将复合动作中的部分成功简单回写成整体成功也不能无条件重放全部动作。约束机制子步骤标识幂等键分阶段证据补偿策略状态冻结人工治理精确重试。结果目标把部分成功造成的风险控制在已发生步骤内避免重试扩大结果。在 Havenlon 中每个 Commit、Executor 调用和 Receipt 都有独立状态复合执行不能只保留一个总状态。6. Cascading Failure级联失效一句话定义级联失效是一个组件或状态的失败沿依赖关系传播导致多个系统、边界或执行能力连续失效的现象。严格定义级联失效可能表现为SaaS 不可用 → Policy 无法同步 → 应用使用缓存 → 缓存已过期 → Arbiter 接受旧状态 → Executor 继续执行或者Evidence Store 堵塞 → 证据无法写入 → 重试队列持续增长 → 设备资源耗尽 → Safe Mode 失效 → 系统状态不一致级联失效的关键问题是故障是否跨域传播下游是否拥有独立拒绝每一层是否把上游结果当成绝对事实是否存在断路机制是否限制传播速率和范围。上位概念Failure PropagationSystemic Failure下位概念Policy CascadeEvidence CascadeNetwork CascadeGovernance CascadeRetry Cascade相关概念Failure ContainmentCircuit BreakerBackpressureCommon-Mode FailureBlast Radius权力边界下游组件不能因为上游异常而自动取消自己的本地约束。约束机制分层不信任独立状态断路限频超时Safe Mode传播边界。结果目标让单一组件故障停留在本层而不是沿执行链放大为系统性失控。在 Havenlon 中SaaS、Application、Arbiter 和 Security Domain 分别维护独立判断阻止单层异常无条件传播。7. Common-Mode Failure共因失效一句话定义共因失效是多个看似独立的组件因共享同一漏洞、权限、依赖、环境或控制路径而同时失效的现象。严格定义共因来源可能包括相同固件相同代码库相同管理员相同更新密钥相同云账户相同 Policy 来源相同数据库相同时间源相同网络相同 AI 模型相同供应链相同恢复入口。例如三个审批账户如果都由同一个管理员控制并不构成三个独立治理主体。两个硬件模块如果共享同一更新密钥和相同固件漏洞也可能同时失效。上位概念Failure ModeSystemic Risk下位概念Software Common-Mode FailureAdministrative Common-Mode FailureCredential Common-Mode FailureSupply Chain Common-Mode FailurePolicy Common-Mode Failure相关概念Boundary CollapseCoordinated CompromiseLayered DistrustDiversityMulti-Layer Collusion约束机制不同职责独立凭证独立更新技术多样性不同控制域共因分析灾难半径约束。结果目标避免架构图上的多个组件在真实失陷时仍然作为同一个单点失败。在 Havenlon 中Arbiter、Security Domain、SaaS 和治理成员需要评估共享密钥、共享管理员和共享更新链风险。8. Single Point of Failure单点故障一句话定义单点故障是某一个组件失效后导致系统无法继续提供必要功能的设计点。严格定义Single Point of Failure 主要描述可用性问题。例如唯一网络连接唯一设备唯一数据库唯一 Owner唯一 Policy 服务唯一证据存储。单点故障并不必然等于安全问题。一个组件失效后系统安全停止可能是可接受的。真正需要进一步评估的是失效后系统是否停机失效后系统是否放宽限制是否存在安全恢复是否导致永久锁死是否产生不可逆状态。上位概念Availability RiskFailure Architecture下位概念Device SPOFNetwork SPOFGovernance SPOFStorage SPOFIdentity SPOF相关概念Single Point of Catastrophic ExecutionRedundancyRecoverySafe FailureHigh Availability容易混淆的概念单点故障回答一个点坏了系统还能不能运行单点灾难性执行回答一个点失陷能不能独自造成灾难两者必须分开评估。约束机制冗余故障转移离线恢复共享治理证据复制备用设备。结果目标减少不必要的永久不可用同时确保冗余机制不引入执行旁路。在 Havenlon 中关键设备可能存在可用性单点但备用和恢复路径必须继续遵守相同执行约束。9. Single Point of Catastrophic Execution单点灾难性执行一句话定义单点灾难性执行是任一单一身份、组件、凭证、管理员或硬件失陷后可以独立完成系统级不可逆动作的状态。严格定义单点灾难性执行可能来自Owner 可以删除所有成员并执行SaaS 可以直接调用执行器单一管理员可关闭 Policy单一密钥可以控制全部资产单一 HSM 客户端可以要求任意签名单一恢复凭证可以重置全部状态单一固件签名密钥可以改写执行边界单一 Security Domain 拥有无限对象和额度。它与普通单点故障不同。一个组件可能不是可用性单点却仍然拥有灾难性权力。上位概念Catastrophic AuthorityExecution Risk下位概念Credential Catastrophic PointAdministrative Catastrophic PointSaaS Catastrophic PointHardware Catastrophic PointRecovery Catastrophic Point相关概念No Unilateral Catastrophic AuthorityBlast RadiusOwner ≠ GodBoundary CollapseDistributed Constraint约束机制权力分离多方约束物理边界限额限频作用域最终否决独立证据。结果目标让任何单点失陷最多造成局部、有限和可恢复影响。在 Havenlon 中设计评审优先识别“谁可以单独造成最大不可逆损失”而不只识别系统可用性单点。

相关新闻