
文档教程知识库【免费下载链接】developer-roadmapInteractive roadmaps, guides and other educational content to help developers grow in their careers.项目地址https://gitcode.com/GitHub_Trending/de/developer-roadmap点击查看免费下载LangSmith 是 LangChain 团队推出的 LLM 应用可观测与评测平台专门面向 AI Agent 场景它自动记录智能体每一次调用语言模型的完整轨迹Trace包括输入、输出与中间推理过程让你能回放任意一步、对比不同提示词版本、衡量成本/速度/错误率并为运行打标签以便检索同时支持沉淀测试集并运行自动化评测防止新代码让 Agent 变差。本文以 developer-roadmap 仓库中 AI Agent 学习路线图roadmaps/ai-agents里的 LangSmith 主题为骨架并结合同路线图内 LangChain、LangGraph、结构化日志与评测等相关文档系统讲解它的核心能力与在 Agent 开发流程中的落地方式。读完后你将掌握LangSmith 的 Trace 机制如何工作、它在调试多步 Agent 行为时的价值、如何用测试集与自动化评测持续保障质量以及如何通过成本/延迟看板做生产监控从而建立可调试、可评测、可信任的 Agent 工程闭环。一、LangSmith 是什么Agent 的行车记录仪与质检车间在 roadmaps/ai-agents/content/langsmithSS8mGqf9wfrNqenIWvN8Z.md 中LangSmith 被定义为帮助你查看并修复 AI Agent 行为的 Web 工具。其核心工作方式是记录 Agent 每次对语言模型的调用、所使用的输入以及得到的回答把一次完整执行拆解成可观测、可回放、可统计的数据。另一个条目 roadmaps/ai-agents/content/langsmithxp7TCTRE9HP60_rGzTUF6.md 则从平台定位上补充它是一个调试、测试、监控 LLM 应用的平台通过追踪每次运行的每个步骤并记录输入、输出与中间推理来工作还支持构建评测数据集、对其运行自动化测试并提供生产环境成本与延迟看板。一句话概括LangSmith Trace追踪 Dataset数据集 Eval评测 Dashboard监控。它由 LangChain 团队构建通常与 LangChain、LangGraph 应用搭配使用但也支持独立接入其他框架这一点在 roadmaps/ai-engineer/content/langsmithbN_ReFUQgkJmWOAFMLXMg.md 中明确说明它自动捕获 LangChain 运行轨迹同时也能用于非 LangChain 代码并支持直接在已记录的 Trace 上运行评测。二、核心能力拆解六个解决 Agent 调试痛点的功能原文档将 LangSmith 的能力概括为以下几项每一项都对应 Agent 开发中的具体痛点能力具体行为解决的痛点调用记录记录 Agent 每次调用 LLM 的输入与回答Agent 内部黑盒出问题无从下手逐步回放可重放执行中的任意一步多步 Agent 某一步出错时难以定位提示词对比比较不同提示词版本的输出差异改提示词后结果好坏无法量化指标统计测量成本、速度延迟与错误率上线后不知 Agent 烧钱多少、快慢如何标签与检索为运行打标签便于搜索海量运行记录中难以找到特定案例测试集与评测存储测试集、运行快速检查改代码后不知道 Agent 是否变差其中成本、速度、错误率三类指标与路线图中 metrics-to-trackv8qLnyFRnEumodBYxQSXQ.md 主题强调的 Agent 可观测指标一脉相承逐步追踪每次调用则正是 structured-logging--tracingzs6LM8WEnb0ERWpiaQCgc.md 所述结构化日志追踪理念的工程化实现——把单个日志条目串成一次完整运行的完整画面这对调试复杂的多步 Agent 行为至关重要。2.1 Trace 机制如何记录每一步LangSmith 的追踪单元称为Run。一次 Agent 执行会展开成一棵 Run 树顶层是整个 Agent 运行往下是每次工具调用、每次 LLM 调用、每个检索步骤等子 Run。每个 Run 至少记录输入Inputs调用 LLM 或工具时传入的内容与参数输出Outputs模型或工具返回的结果中间推理Intermediate reasoningAgent 在工具调用前的思考过程如 ReAct 风格的 reasoning 步骤元数据Metadata耗时、Token 用量、模型名等供成本与延迟统计使用。这与 react-reason--act53xDks6JQ33fHMa3XcuCd.md 描述的 ReActReason Act循环天然契合Reason 与 Act 交替的每一步都能被单独记录与回放从而把模型为什么这么干变成可审计的证据链。2.2 回放、对比与打标签让调试从猜变成查原文档强调的三个高频操作是回放任意一步Replay any step当 Agent 在某个环节产出错误结果你可以把该 Run 单独重放微调输入或参数后再次执行验证修复是否生效无需重跑整条链路。对比不同提示词Compare different prompts同一输入下并行对比多版系统提示词或工具描述的输出直观看出哪版更符合预期这是 iterate-and-test-your-promptsnoTuUFnHSBzn7GKG9UZEi.md 所倡导的一次只改一个变量、记录每次变更效果迭代法在工程层的落地。打标签便于搜索Tag runs for easy search为 Run 附加标签如customer-support、v2-prompt、needs-review在海量运行记录中按标签、输入特征或错误类型快速过滤找到问题案例。2.3 评测能力防止新代码让 Agent 变差原文档特别指出LangSmith可以存储测试集test sets并运行快速检查quick checks让你知道新代码是否让 Agent 变得更差。工作流为从线上真实 Trace 或人工构造的案例中沉淀一批输入-期望输出对构成测试集配置评测器Evaluator可以是基于规则的校验、LLM-as-a-judge或与 deepeval0924QUH1wV7Mp-Xu0FAhF.md、ragasYzEDtGEaMaMWVt0W03HRt.md 等评测框架集成每次代码改动改提示词、换模型、调整工具后对测试集跑一遍比较新旧得分若指标下降说明改动引入了回归回退或继续迭代。这套流程正是 human-in-the-loop-evaluationrHxdxN97ZcU7MPl8L1jzN.md 主张的自动分数人工判断结合自动化评测快速筛出问题人工审阅标记数字看不出的隐藏偏见或别扭表达二者交替迭代直到满足质量与信任目标。2.4 生产监控用图表看清成本、延迟与错误率上线之后LangSmith 通过清晰的 Trace 视图与统计图表帮助团队持续回答三个问题成本每次运行消耗多少 Token、费用几何方便对照 token-based-pricing1fiWPBV99E2YncqdCgUw2.md 与 pricing-of-common-modelsB8dzg61TGaknuruBgkEJd.md 给出的模型价格做预算核算速度各环节延迟分布找出耗时瓶颈如某次检索或工具调用过慢错误率失败调用占比及错误分布第一时间暴露线上回归。结合 structured-logging--tracingzs6LM8WEnb0ERWpiaQCgc.md 的视角这些图表本质上是把结构化日志数据聚合为可检索、可过滤、可程序化分析的监控面板——这正是调试复杂多步 Agent 行为的基础设施。三、在 AI Agent 路线图中的定位在 developer-roadmap 的 AI Agent 学习路线中LangSmith 与周边主题构成一条完整的构建—调试—评测—上线链条构建层用 LangChain 编排链式调用与 Agent 循环用 LangGraph 构建有状态的图式 Agent观测层LangSmith 自动捕获上述框架的运行轨迹与 langfuseUoIheaJlShiceafrWALEH.md、openllmetry7UqPXUzqKYXklnB3x-tsv.md、heliconeMLxP5N0Vrmwh-kyvNeGXn.md 等同属可观测性工具的备选评测层LangSmith 的测试集与自动化评测可与 deepeval、ragas 等评测框架协同质量保障层与 human-in-the-loop-evaluation、integration-testing-for-flowsP9-SiIda3TSjHsfkI5OUV.md、unit-testing-for-individual-toolsqo_O4YAe4-MTP_ZJoXJHR.md 一起构成多层次的测试策略单个工具做单元测试、整体流程做集成测试、上线后靠 Trace 与人工反馈持续评估。值得注意的是路线图中 LangSmith 主题出现了两个条目一个侧重记录每次调用、回放、对比、打标签的调试功能另一个侧重追踪每步输入/输出/中间推理、构建评测数据集、生产成本延迟看板的平台全貌两者合并即为完整的 LangSmith 能力画像本文已在上文全部覆盖。四、何时选择 LangSmith与自建日志、其他观测工具的取舍LangSmith 的适用前提依据路线图文档与周边主题推断包括你的 Agent 基于 LangChain / LangGraph 构建——Trace 自动捕获集成成本最低即使是非 LangChain 代码也支持手动上报 Trace你需要测试集自动化评测来约束迭代——这是从能跑走向可回归的关键你需要向团队/客户展示成本、延迟与错误率的量化证据即让 Agent 可信任。如果你的诉求只是最简单的文本日志可以参考 structured-logging--tracing 自行实现结构化记录如果需要开源自托管、强隐私隔离可以评估路线图中的 langfuse 或 openllmetry 等替代方案。LangSmith 的价值在于把观测、调试、评测、监控打包成一个闭环避免团队在多个工具之间来回拼装。五、落地建议与学习资源按原文档给出的官方入口LangSmith 官网、LangSmith 文档、使用 LangSmith 评测加固你的应用以及一篇面向开发者的介绍文章《What is LangSmith and Why should I care as a developer?》建议的落地顺序为先在开发环境接入 LangSmith让每一次 Agent 运行自动产生 Trace养成先看 Trace 再改代码的习惯针对高频失败场景建立小规模测试集配合自动评测形成回归基线上线后关注成本、延迟、错误率三类看板把评测结果与线上监控串成持续改进的循环——正如 iterate-and-test-your-prompts 所述把尝试—观察—调整—重试从提示词层面扩展到整个 Agent 系统层面。结语LangSmith 解决的核心问题是 LLM 应用与 Agent 的不可观测性。通过清晰的 Trace、可回放的步骤、可对比的提示词、可检索的标签、可量化的成本/速度/错误率以及测试集自动化评测的回归保障它把调试、改进与信任建立变成一个有据可查的工程流程——这正是 AI Agent 从原型走向生产所必需的基础设施。赞分享文档教程知识库【免费下载链接】developer-roadmapInteractive roadmaps, guides and other educational content to help developers grow in their careers.项目地址https://gitcode.com/GitHub_Trending/de/developer-roadmap点击查看免费下载相关推荐LangSmith 可观测性实战指南LLM 应用的 Tracing、评测与生产监控LangSmith 可观测性实战指南LLM 应用的 Tracing、评测与生产监控 LangSmith 是面向 LLM 应用的开发与可观测性平台核心能力覆盖AI 技能人工智能大模型深度学习Perfetto Agent Evals用可控实验量化评测 AI 编码 Agent 的 Trace 调试能力Perfetto Agent Evals用可控实验量化评测 AI 编码 Agent 的 Trace 调试能力 本文以 ai/evals/README.md h可观测性后端开发工具前端数据可视化Phoenix CLI Agent Starter Kit 可观测性实战用 phoenix-cli 逐层调试 AI Agent 的 Trace 数据Phoenix CLI Agent Starter Kit 可观测性实战用 phoenix cli 逐层调试 AI Agent 的 Trace 数据 导读 本可观测性AI 评测LLMOpsAI 应用人工智能上一篇目标选择与接近策略Hacker101 赏金猎手如何挑选攻击目标下一篇DoWhy 后门准则Backdoor Criterion从识别因果效应到四类调整集算法的完整实战指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考