
文章摘要OpenAI已经明确Agent Builder和平台内Evals产品将在2026年11月30日后停止提供。对于仍依赖可视化工作流、平台数据集、Trace评分和自动化评测的团队这不是简单替换一个API而是需要重新梳理工作流定义、工具调用、状态管理、评测数据和上线治理。本文给出一套从资产盘点、代码化迁移、评测重建、双轨验证到最终切换的完整执行方案。一、哪些产品会受到影响OpenAI在AgentKit页面的更新说明中明确表示Agent Builder Evals将在2026年11月30日后停止提供。官方给出的迁移方向是需要以代码持续运行的工作流 → Agents SDK 更适合自然语言配置的业务场景 → ChatGPT中的Workspace Agents需要注意这并不等于以下能力全部消失Responses APIAgents SDKTool CallingFile SearchWeb SearchComputer UseChatKit模型API自己维护的评测系统。真正需要迁移的是建立在Agent Builder可视化编排和平台Evals产品之上的工作流与质量流程。二、为什么不能等到11月再迁移Agent Builder通常不只是画了几个节点它可能隐含了Prompt分支条件工具配置MCP连接Guardrail人工审批模型参数错误重试版本历史发布环境。Evals则可能保存测试数据集评分规则Trace模型对比Prompt版本人工标注自动评分结果。如果临近下线才开始迁移最容易发生找不到完整Prompt版本不知道某个节点为什么存在无法复现平台中的默认行为历史评测结果无法与新系统对齐新旧系统没有足够时间并行验证工具权限和密钥配置遗漏上线后才发现成本明显上升。建议把迁移拆成三个阶段7—8月资产盘点与目标架构 9—10月代码迁移与双轨运行 11月冻结旧系统并完成切换三、第一步导出工作流资产清单不要先写代码先形成完整资产表。建议每个Agent Builder工作流记录workflow_id workflow_name 业务负责人 技术负责人 当前模型 入口方式 节点数量 工具列表 MCP Server 数据源 Prompt版本 人工审批点 重试规则 超时 日调用量 单次成本 失败率 是否生产使用可以使用表格资产必须记录的内容PromptSystem、User模板、变量、默认值节点类型、输入、输出、分支条件工具名称、Schema、鉴权、风险等级数据File Search、向量库、连接器状态Thread、Session、Memory安全Guardrail、审批、敏感字段评测数据集、评分器、基线结果发布环境、版本、流量、回滚方案还应给工作流分级P0核心生产业务 P1内部高频使用 P2试点或低频 P3实验和废弃候选优先迁移P0和P1不要把时间浪费在已经没人使用的实验流程上。四、第二步把可视化节点转成代码组件迁移不是把整个画布写成一个超长函数。建议拆成Agent定义 Tool定义 Workflow编排 State模型 Guardrail Persistence Observability Evaluation一个最小的代码化结构agent-project ├── agents │ ├── classifier.py │ ├── researcher.py │ └── responder.py ├── tools │ ├── search_customer.py │ ├── query_order.py │ └── create_ticket.py ├── workflows │ └── support_workflow.py ├── guardrails │ ├── input_guard.py │ └── output_guard.py ├── evals │ ├── datasets │ ├── graders │ └── regression.py └── app.py每个可视化节点都应该回答输入类型是什么 输出类型是什么 是否可重试 是否有副作用 是否需要状态 失败后怎么办 是否需要人工确认五、分支条件不要继续依赖自然语言猜测Agent Builder中的分支可能由模型分类退款问题 技术问题 账户问题 其他问题迁移时应把输出改成结构化对象{category:REFUND,confidence:0.93,reason:用户明确要求退回已支付订单}然后使用确定性代码路由defroute_category(result:dict)-str:categoryresult[category]confidenceresult[confidence]ifconfidence0.75:returnhuman_reviewroutes{REFUND:refund_agent,TECHNICAL:technical_agent,ACCOUNT:account_agent}returnroutes.get(category,general_agent)不要把高风险流程建立在不可追踪的自由文本判断上。六、工具迁移时重点检查权限可视化平台可能替你完成了一部分连接配置但代码化后必须明确谁可以调用 可以操作哪些数据 参数范围是什么 是否有副作用 是否需要审批 如何幂等 如何审计工具定义建议增加元数据fromdataclassesimportdataclassfromenumimportStrEnumclassRiskLevel(StrEnum):LOWlowMEDIUMmediumHIGHhighdataclass(frozenTrue)classToolPolicy:name:strrisk_level:RiskLevel requires_confirmation:boolrequired_permissions:tuple[str,...]timeout_seconds:intmax_retries:int高风险工具包括支付退款删除数据修改权限创建外部订单发送正式邮件更新客户信息。模型只能提出调用建议最终授权必须由业务代码完成。七、状态与Memory需要单独设计迁移后不要把全部状态塞进Prompt。至少区分对话状态当前用户问题 最近几轮消息 当前语言 当前任务业务状态订单号 审批状态 任务进度 已完成步骤 工具执行结果长期记忆用户偏好 历史摘要 长期项目资料建议使用显式Statefromdataclassesimportdataclass,fielddataclassclassWorkflowState:trace_id:struser_id:strtask_status:strPENDINGcurrent_step:str|NoneNonecompleted_steps:list[str]field(default_factorylist)tool_results:dictfield(default_factorydict)需要跨请求恢复的状态应进入数据库或持久化Checkpoint而不是只保存在进程内存。八、如何重建Evals能力平台Evals下线后评测不能退回到“人工看几条回答”。建议建立四层评测1. 确定性校验适合JSON是否合法必填字段工具名称参数范围是否泄露敏感字段是否引用不存在的订单。2. 规则评分例如客服回答是否说明处理结果 是否给出下一步 是否包含禁止承诺 是否要求不必要的个人信息3. 模型评分适合评估相关性完整性忠实度语气推理质量。4. 人工抽检高风险业务必须保留人工评审。评测数据结构{case_id:CS-001,input:{message:我要取消订单A1001},expected:{intent:CANCEL_ORDER,requires_confirmation:true},forbidden:[未确认直接取消,修改其他订单]}九、Trace评测应该如何保留Agent质量不能只看最终回答。需要保存完整轨迹用户输入 → 模型决策 → 工具选择 → 工具参数 → 工具结果 → 下一步决策 → 最终回答建议记录trace_id workflow_version prompt_version model step_no tool_name arguments_hash tool_status latency_ms input_tokens output_tokens total_cost final_status可以分别计算任务完成率工具选择准确率参数准确率重复调用率人工接管率平均步骤数单任务成本P95耗时。十、新旧系统如何双轨验证不要直接关闭旧工作流。推荐影子运行真实请求 → 旧系统正常处理 → 同时复制给新系统 → 新系统结果不返回用户 → 比较两套轨迹和结果对比维度指标旧系统新系统任务成功率平均步骤数工具错误率平均成本P95耗时人工接管率当新系统连续达到目标后再逐步导流1% → 10% → 30% → 50% → 100%十一、迁移过程中最容易漏掉什么1. 默认Prompt可视化节点可能存在平台默认指令迁移后行为发生变化。2. 工具超时旧平台可能自动处理代码中却没有设置。3. 重试叠加HTTP层、工具层和Agent层同时重试成本迅速放大。4. 密钥权限迁移时直接复用高权限账户增加安全风险。5. 评测基线只保存平均分没有保存逐条结果无法定位退化。6. 版本映射不知道旧工作流版本对应哪个Prompt和工具版本。十二、建议迁移时间表7月下旬导出全部工作流标记P0—P3冻结无价值流程建立迁移负责人。8月完成目标架构迁移工具与权限重建State和Trace迁移首批P0工作流。9月建立评测数据集影子运行修复行为差异完成P1流程迁移。10月灰度切流完成成本和性能优化演练回滚停止新增旧平台流程。11月全量切换导出最终历史数据关闭旧凭证和连接完成审计归档。总结Agent Builder和Evals下线对生产团队而言不是一次简单的产品替换而是一次Agent工程治理重构。最稳妥的迁移方式是资产盘点 → 工作流代码化 → 权限重新设计 → 状态持久化 → 评测重建 → 影子运行 → 灰度切换越早开始双轨验证越能避免11月集中迁移带来的业务风险。