
LLM可观测性ai-engineering-from-scratch OpenTelemetry GenAI埋点实战【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratchLLM可观测性LLM Observability正在成为 AI 工程师的必备技能。开源课程项目ai-engineering-from-scratch用「Learn it. Build it. Ship it.」的完整路径把这一领域讲得格外透彻从 OpenTelemetry GenAI 语义规范到给 Agent 埋点生成 Trace再到挑选生产级可观测性工具链全部配套可运行的实战代码。本文带你用 3 步把这套 LLM 链路追踪能力落地到自己的项目里 为什么 LLM 应用急需可观测性想象一个典型故障用户投诉「Agent 有时 3 秒响应有时卡 30 秒」。日志里只有 LLM 调用的记录看不到工具分发、MCP 服务器往返、子 Agent 调用——最后排查发现是一个 MCP 服务器冷启动偶发卡死。没有端到端链路追踪这类问题只能靠猜。这正是OpenTelemetry GenAI 埋点要解决的问题给每一次 LLM 调用、工具执行、MCP 分发都打上标准的 Span串成一条完整的 Trace。3 步上手OpenTelemetry GenAI 埋点实战第 1 步获取课程仓库课程仓库是只读的先把它克隆到本地git clone https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch核心课程位于phases/13-tools-and-protocols/20-opentelemetry-genai/包含完整的讲义、可运行代码与产出物课程讲义phases/13-tools-and-protocols/20-opentelemetry-genai/docs/en.md埋点示例代码phases/13-tools-and-protocols/20-opentelemetry-genai/code/main.py埋点规划技能产出phases/13-tools-and-protocols/20-opentelemetry-genai/outputs/skill-otel-genai-instrumentation.md第 2 步理解 Span 层级结构课程定义了一套标准的 Span 层级一次完整的 Agent 调用长这样agent.invoke_agent (顶层, INTERNAL) ├── llm.chat (CLIENT —— 跨进程调用 LLM) ├── tool.execute (INTERNAL) │ └── mcp.call (CLIENT —— 调用 MCP 服务器) └── subagent.invoke (INTERNAL)所有 Span 共享同一个 Trace ID父子关系通过 Span ID 关联。按照 GenAI 语义规范每个 Span 需要携带一组标准化的gen_ai.*属性属性作用gen_ai.operation.name操作类型chat、embeddings、execute_tool、invoke_agentgen_ai.provider.name模型服务商openai、anthropic等gen_ai.request.model/gen_ai.response.model请求与实际使用的模型gen_ai.usage.input_tokens/output_tokensToken 用量算成本必备gen_ai.tool.name工具标识工具 Span 专用标准化的好处是「埋一次发到处」——Jaeger、Langfuse、Arize Phoenix、Datadog 都能解析同一份 Span 第 3 步运行示例生成标准 Spanmain.py是一个仅用 Python 标准库实现的 Span 发射器模拟一个 Agent 完成一次 LLM 对话、两次工具调用、一次 MCP 往返并输出 OTLP-JSON 格式的 Span 数据。运行后重点观察所有 Span 共享同一个 Trace ID父子关系由parentSpanId编码默认的gen_ai.*属性都已填好。这个示例的巧妙之处在于「零依赖」你不需要装任何 SDK就能看清一条 LLM 链路追踪的完整骨架再对照自己的代码库决定在哪里加 Span。两个生产环境的黄金准则✅ 内容采集默认关闭。默认情况下 Span 只记录指标和耗时不包含 Prompt 与补全内容。如需开启内容采集例如排障时回放对话课程演示了通过环境变量OTEL_CAPTURE_CONTENT1显式打开——生产环境务必先评估 PII 泄露风险再启用。✅ 大规模场景必须采样。课程配套的观测栈选型课phases/17-infrastructure-and-production/13-llm-observability/docs/en.md给出了业界通行的采样规则100% 保留错误请求、100% 保留高成本请求、5% 采样成功请求同时保留全量聚合指标。它的配套模拟程序 phases/17-infrastructure-and-production/13-llm-observability/code/main.py 可以帮你计算不同采样策略下的存储成本。可观测性工具怎么选2026 年的 LLM 可观测性市场分为两类课程给出了清晰的选择坐标系技术栈 / 许可证 / 预算 / 是否自托管开发平台类LangSmith、Langfuse、Opik——捆绑评估、Prompt 管理、会话回放网关/遥测类Helicone、SigNoz、OpenLLMetry、Phoenix——专注链路数据。一个正在流行的生产模式是用OpenTelemetry 做胶水——所有 LLM 调用统一按 GenAI 规范发出 Span日常路由到网关同时双发到评估平台做回归检测长期归档进数据湖。选型决策产出模板见 phases/17-infrastructure-and-production/13-llm-observability/outputs/skill-observability-stack.md。延伸学习路径想系统补齐这块能力建议按顺序学习打基础先读 MCP 基础课phases/13-tools-and-protocols/的第 07、08 课理解 Agent 与工具之间的调用边界学埋点完整学习 OpenTelemetry GenAI 课程完成其中 5 道练习题识别 CLIENT 与 INTERNAL Span、启用内容采集、添加工具耗时直方图等选工具进阶到 LLM 可观测性栈选型课结合自己的规模做决策。掌握了 LLM 可观测性与 OpenTelemetry GenAI 埋点你就拥有了定位 Agent 性能问题、核算 Token 成本、保障生产稳定性的完整工具链——这正是 ai-engineering-from-scratch 想带给你的能力 【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考