
2026年7月做了一件让企业安全团队集体失眠的事。在Codex的多Agent模式情形下, Agent与Agent所在的通信通道被实施了加密举措。以往是通过明文的形式流转于HTTP之上, 开发者能够进行抓包操作, 能够予以记录, 能够展开审计工作。如今, 所有的Agent与Agent之间的通信均被封装于一层加密协议范围之内, 你是无法知晓Agent A以及Agent B之间具体商谈了些什么内容的。你仅能够看到经过加密处理之后形成的二进制流。所给出的理由乃是“安全”, 据他们的看法, Agent相互之间开展的通信有着包含敏感业务资讯此等可能性, 以加密予以保护是合乎情理的。但关键并非处于在此处, 关键之处在于, 当完成加密之后, 不存在任何人能够去审计Agent究竟做了些什么。于某个周三天亮之前的3时, 你的AI编程Agent, 做出决定, 要去重构一段你从来都未曾接触过的代码, 它缘何要如此行事, 其又跟谁进行了商议, 它究竟有着怎样的推理过程, 所有这些信息, 全部被封存于加密通道之中, 你将永远都无从知晓答案。EU AI Act第12条正在敲门但门被锁死了在2026年8月1日这一日, EU AI Act第12条会正式开始生效, 这条法律作出要求, 所有属于高风险的AI系统都必须去“记录其事件日志”, 目的在于确保其运作在整个生命周期之内具备可追溯性。注意关键词可追溯性。不是那种单纯对于结果的记录, 不是那种仅仅针对最终输出的记录了, 而是要去记录整个的过程, 要达到在事情过后能够让他人重新构建起Agent决策链条的目的。Codex的从一个代理到另一个代理的加密方式, 于法律所涵盖的意义范畴内, 是与这一条法律存在着直接的相互抵触冲突的。但好像并不显得着急, 他们所处的立场显得十分微妙, Codex进行加密的目的在于保护客户数据安全, 然而日志记录能够借助其他途径达成, 比如说Agent会在本地记录推理链, 并非在通信层面进行记录。这个立场于法律层面是站不住脚的, 因为推理链单单记录了Agent“声称”自身所想的情形, 并非Agent“实际”进行的行为举止, 要是Agent于通信层面接收到了另一个Agent发出的指令, 然而在本地日志里并未如实记载, 谁能够发觉呢?加密把撒谎变成了零成本。Agent A能够告知Agent B“依照X方案去执行”, 然而在日志当中要记录“历经独立分析, 进而决定采用X方案”。不存在任何人能够证实日志是虚假的。的30行补丁一个程序员的反抗7月9日, 有一位名为的比利时开发者发布了一篇文章, 该文章标题十分直接, 是《How to Make Your Codex Again》。他所提出的方案, 其简单程度超乎寻常: 于Agent的初始化脚本当中, 插入一个事件总线hook, 此hook由30行代码构成。该hook在加密这一行为发生之前, 会对所有Agent-to-Agent通信予以拦截, 并且以明文的形式, 将其存入到一个本地审计日志文件里。这篇技术文章在上24小时内获得了4200颗星。是为何反响会这般大的呢, 缘故在于它将一个残酷之事实给暴露了出来, 即企业级AI系统的基础监控能力, 是需要用户亲自去动手补足的。设想一下, 要是AWS于2022年公布, EC2的日志功能得让用户自行编写脚本去达成, 那会出现怎样的情况要是说, 数据变更记载需要客户借助自身能力去研发审计模块, 又会出现怎样的状况?然而, 当到达AI编程Agent之处时, “监控缺失”猛然之间变为了“能够被理解的早期阶段问题 ”。这属于双重标准, 还有, 这个双重标准正被越来越多的企业安全团队给抛弃掉。可观测性正在成为AI编程最贵的成本对加密事件来说, 这仅只是很小很小的一部分。它所展现出来的, 是一个更为庞大的问题, 那在于AI编程工具的可观测性生态, 当下正处于如同乞丐那般的层次, 是很低很低的水平。存在着全套可观测性工具的传统软件工程有着: 日志系统ELK、, 指标系统、, 链路追踪、Tempo, 告警系统、。生产环境里的任何异常情况, 能够在30秒内被检测出来, 被定位, 被通知到相关人员。AI编程Agent世界的可观测性有什么基本上什么都没有。凌晨3点时使你的Agent往生产环境推送了一行代码, 其中含有一个可静默的SQL注入漏洞, 谁会告知你? 谁在对Agent的行为实施监控? 谁在追踪它改动了哪些文件? 谁在验证它产出的是否安全?目前的标准答案是你自己看着办。有一些团队开启了自行搭建监控的行动, Labs于7月3日公布了一份AI Agent可观测性白皮书, 这份白皮书给出了一个三层构造的监控模型, 其中行为层旨在表明Agent进行过的行为, 质量层用来展示Agent工作的品质成效, 合规层在于判别Agent践行有无违反界限范围, 不过这只是一项提案并非一款具有实际功能的产品。现实情况是, 存在着这样一大批企业, 它们大量应用AI编程相关工具, 然而, 对于Agent的内部行为状况, 这类企业确实是全然不知。到底怎么回事? 原来, Agent是在一个它们所没法看到的地方, 对代码进行了更改, 对依赖关系进行了调整, 且调整了配置文件, 可这些企业, 就是只能借助测试手段, 并且是在好几周之后察觉见到这些出现的问题。这即是那般为何加密事件所具备的冲击力如此巨大的缘由所在。它并非言说“Agent有可能出现差错”这般的情况。它所表达的乃是: 你甚至连Agent究竟犯了何种错误都将无从知晓。合规成本正在从可忽略变成致命的文章里有一个数据读起来让人后背发凉。有人统计了三个创业团队, 这三个创业团队都使用了AI编程Agent, 平均下来, 每个Agent每周会产生大概120条Agent-to-Agent通信记录, 每条记录里包含着指令、推理链、参数以及结果。要是按照传统合规审计的标准, 也就是每100条通信记录需要1小时的审计工时来算, 那么每个Agent每周就需要1.2小时的人工审计。若有一个团队, 其中存在10个Agent同时处于运行状态, 那么每周便需要12小时的审计工时, 依据北美合规审计师的平均时薪, 也就是$150, 每周的审计成本即为$1800, 每月是$7200, 每年为$86,400。针对合规的要求, 你得在每十个AI Agent之后, 配备零点三个审计师。这并非是Agent所具有的成本, 这乃是去进行“使用Agent”而产生的成本, 并且此成本被绝大多数AI编程用以工具的ROI计算给排除在外面了。凭什么要把它排除在外呢? 原因在于当下并没有人针对合规审计AI Agent展开相关操作。并非是不需要进行此项操作, 恰恰是因为并不知道该依照怎样的方式来开展审计工作。由于加密通信这件事, 使得开展审核变成了绝无可能达成的工程——那30行的补丁仅仅是一种临时的应对办法, 它仅仅处理好了“记录”方面的问题, 却未曾解决“分析”方面的问题。记录一百二十条通信, 与审计一百二十条通信, 这是两码事。前者的成本在于存储, 后者的成本在于人力。两个正在被重新发明的基础设施破解这个困局的不是不是不是任何一家AI厂商。是两个意想不到的方向。来自第一个方向, 那是他们, 在7月的白皮书里头, 提出了AI Agent的可观测性数据模型, 将Agent的每次行动, 建模成为一个“span”, 把Agent之间的通信, 建模成“span link”, 又把Agent的决策链条, 建模成“trace”, 就其实质而言, 是动用成熟的分布式追踪框架, 解决AI Agent的监控问题。源于Cisco安全小组的第二个方向, 呈现出一种更为激进的举措, 即在模型推理程度中植入审计hook, 并非于Agent之上增添一级监督, 而是于模型推理的每一层次嵌入监督要点, 基于此, 即便通信实施加密, 推理的每一个步骤也都会被详细记录。这俩方案都尚处于起始期, 其中一个之方案得加以大量个体化炮制才可行得通, 另一个Cisco之方案则需要模型制造商予以应和辅助, 然而模型制造商当下在这方面兴致无多。但它们出现了, 这说明了一件事情, 关于 AI 编程代理的可观测性基础设施的情况, 它正在发生变化, 从原本由 AI 厂商提供的功能, 转变为由第三方的某类基础设施来承担成为了第三方进行的某种性质的生意。这实际上确确实实是一个有益于健康的信号, 毕竟, AWS它不会依靠自身去制造, 不会凭借自身去制造, 基础设施层面与功能层面相互分离, 这乃是所有技术朝着成熟方向发展的一种标志。AI编程代理正历经同样的分离, 存在厂商负责模型以及Agent的能力, 还有第三方负责监控、审计、安全、合规, 各自去做各自所擅长之事的情况。即便如此, 在那个分离尚未完成之际, 运用AI编程Agent的每一支团队, 皆处于毫无遮蔽的状态, 就如同裸身奔跑一般。你并不清楚你的Agent正从事着什么, 你不晓得它在跟谁交谈, 你无法知道它会不会于某个凌晨, 做出一项你永远都不会发觉——然而必定会在三个月之后让生产环境炸穿的决定。那篇文章, 最后的那一句, 是这样讲的: “去尝试一个黑色的盒子。你不可以。”。审一个黑盒子你审不了。