
本文整理自 QCon 北京 2026 钱世俊分享《构建大规模Agent的CT系统火山引擎Agent可观测实践》通过AI音视频总结工具Ai好记进行转录整理以下是整理后的会议笔记内容。Agent 能力越来越强能自我规划、调用工具、使用记忆和知识库但一旦变慢、报错、答非所问排查起来特别费劲因为内部是个黑盒。火山引擎应用观测团队提出了一套「Agent CT 系统」的解法就像医学上做 CT 一样把 Agent 内部的每一步决策都透视出来。这篇文章把他们的统一观测底座和 AI 深度观测拆开讲。Agent 的三大黑盒困境Agent 和传统应用不一样传统应用代码写定、执行确定Agent 会自己规划任务、调用外部工具、积累记忆一次请求内部是复杂的工作流不是单一 LLM 调用。这带来三个问题可见性从用户输入到最终返回中间到底发生了什么。可解释性慢在哪、错在哪、成本为什么飙升。可行动性能不能从观测里总结出优化方案形成闭环。从工程落到系统上就是横跨基础设施到应用层的监控断层。一个 Agent 系统分四层业务系统、Agent 框架、大模型服务商、云基础设施。每层关心不同指标分散在不同观测系统里产生了三个断层链路断层TraceID 丢失、上下文透传遗失、语义断层跨供应商链路孤岛、因果断层底层硬件指标和上层推理逻辑脱节。统一观测底座五大支柱火山引擎建设了一个统一观测底座核心是把 Metrics、Logs、Traces 这「三驾马车」和 AI 时代的 Prompt、Token 消耗等数据融合起来协同五大支柱。统一观测门户把云监控、托管 Prometheus、应用观测、云拨测、日志分析等产品汇聚到一起研发不用在不同控制台来回切换。统一集成能力拥抱 OpenTelemetry 完整标准生态核心是自研采集器 OneAgent。团队做了很多性能优化比如发送并发度自适应调整、map 改成多浪标准库、预分配大块内存、对象池引用计数。200K DPS 压测下吞吐高一倍线上负载降 50% 以上部分重载节点性能提升近 3 倍。统一数据加工数据脱敏、黑白名单过滤、数据富化补齐上下文标签、错误码映射业务语义、日志链路转指标、高基数指标预聚合、冷热分离存储。统一看板跨类型数据联动一个仪表盘里指标曲线、日志流、链路拓扑同绘兼容 Grafana JSON 模型一键平滑迁移还有开箱即用的预置行业模板。统一告警智能告警降噪收敛风暴、统一告警配置管理、TTFT 突增、Token 成本暴涨、工具调用大面积失败等规则做成预置模板。AI 与大模型深度观测在统一底座之上火山引擎打通了从模型层到基础设施层的完整调用闭环。基于 OpenTelemetry 扩展 AI 语义规范对不同框架、不同模型供应商做数据归一化无论你用 OpenAI、火山方舟还是 Anthropic 都有一致的观测体验再把 Prompt 到 Response 的内容分析到底层 GPU 利用率、网络吞吐全栈关联。最终形成三大观测能力实时拆解 TTFT 数据抖动判断是模型思考慢还是吐字慢按业务、用户、模型维度做 Token 消耗聚合分析揪出成本大头对多轮会话做脱敏保存和整体管理用于排查、评估和安全审计。从观测到工程化闭环观测不是终点要能回流到排错、调优和迭代。火山引擎提出了「一链路白盒化、解释根因、推进业务闭环」的目标从观测数据回流评测优化再到线上验证。整个思路对任何做 Agent 或大模型应用的人都有直接的参考价值尤其是成本管控这块Agent 触发大量模型调用导致 Token 消耗剧烈增长是传统微服务时代没有的问题。总结Agent 的可观测不是把四层监控简单拼在一起而是先建统一底座打通数据再做 AI 专属的深度观测最后形成工程化闭环。这套「CT 系统」的比喻很贴切先看清内部每一步才能解释根因才能动手优化。常见问题 FAQ问Agent 成本为什么容易失控答Agent 内部经过各种编排出问题时可能在短期内触发大量大模型调用Token 消耗剧烈增长。需要通过按维度聚合的 Token 监控及时发现成本大头。问四层监控断层的根因是什么答四层分散在不同观测系统采集方式不同导致链路断层、语义断层、因果断层跨供应商链路孤岛让排障变得困难。问统一观测底座的核心是什么答融合多维度观测数据协同统一接入、统一加工、统一门户看板、统一告警五大支柱为 AI 深度观测提供前置能力。以上内容由 Ai好记 转录整理。Ai好记 是一款音视频转图文笔记的AI音视频转录总结工具支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件转录后自动视频转文字生成精华速览、思维导图和结构化笔记等内容形式帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。