尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Agent Harness 从原理到实战:大模型不干活,全靠智能体运行框架在撑

Agent Harness 从原理到实战:大模型不干活,全靠智能体运行框架在撑 这层壳就是今年 AI 编程圈最值得弄明白的概念Agent Harness。官方用一句话概括它的定位Model Harness Agent——模型负责思考Harness 负责把事做完。我写这篇文章的时候自己就运行在 Agent Harness 里。下面从原理讲到实战看完你就能看懂 Claude Code、DeepSeek Harness 这些工具到底在忙什么。先点个收藏我们开始。一、Agent Harness 是什么给只会读书的模型装上手大模型本身不会干活真正在干活的是模型外面那层 Harness。Agent Harness智能体运行框架Anthropic 官方术语表给出的定义是「把语言模型变成能干活的编码代理所需的工具、上下文管理和执行环境」。你可以把它理解为「给只会思考的模型装上的手脚和缰绳」。Anthropic 说得更直白Claude Code 是 harnessClaude 是里面的模型。Claude 负责想harness 负责把想出来的每一步落到实处。我举个生活的例子。想象公司里来了个绝顶聪明、但没手没脚的研究员他脑子转得快可拿不了笔、开不了门、翻不了资料。你得给他配个助理——递文件、抄结果、把关哪些门能进。这个助理就是 Harness。所以别把 Agent 想成「一个更聪明的模型」它其实是「一个模型 一个替它干活的框架」Agent Model Harness这个视角一旦建立你再看 Claude Code、Codex、DeepSeek Harness 这些工具就不会问「它是什么模型」而是问「它给模型装了什么手脚」。二、核心机制工具调用循环模型永远不会自己执行任何操作——它只发出请求执行、反馈、再决策全靠一个循环完成。Agent Loop代理循环也叫工具调用循环是模型「思考→调用工具→看结果→再思考」的循环直到它认为任务完成。你可以把它想成跑腿办事想一步走一步看看结果再想下一步。Anthropic 官方文档里有句话我印象很深「模型永远不会自己执行任何操作。它发出一个结构化请求tool_use由你的代码或 Anthropic 的服务器来执行再把结果回填进对话。」也就是说你让 AI「帮我把这个报错修了」模型哪怕胸有成竹也没能力动你电脑上一个字节。真正动手的是 harness 里的这个循环。看图 1注意「权限检查」这一环——它是 Harness 区别于普通脚本的关键。循环什么时候停三选一模型自己认为任务完成输出最终回复触达最大轮数或者烧到预算上限被强制叫停。我试过把同样的任务直接喂纯 API模型给出一堆高质量建议但就是不会动手改文件——因为没有循环替它执行。那一刻我懂了会调 API 和会干活是两码事。可能有人会问模型不都会调 API 吗为什么还需要 Harness会调 API 不等于会干活。调 API 是一次性的你发请求、拿回复中间没有循环。Harness 提供的是循环、工具执行、权限和上下文管理——就像会打电话订餐不等于会经营一家餐厅。三、三大支柱工具、上下文、权限Harness 的价值不在某个工具而在于把工具、上下文、权限三件事拧成一套能转的循环。模型能干活靠的是三根支柱。少一根循环就转不顺。1工具层模型的「手」 harness 给模型预装一双手Bash跑命令、Read / Write / Edit读写文件、Grep / Glob搜代码、WebSearch联网查资料。在 Claude Code 里只读工具Read、Grep可以并行跑会改状态的Edit、Write、Bash要串行防止互相踩脚。2上下文管理模型的「工作台」上下文压缩Context Compaction对话快接近窗口上限时harness 把前面一大段历史总结成一份摘要继续干活避免「聊太久忘了开头」。就像整理书桌东西多到放不下时把旧资料归档成一张便签。Claude Code 默认上下文窗口 200k token快满时自动压缩也可以手动 /compact 指定保留什么、/clear 彻底重开。3权限模型模型的「门卫」权限模型Permission Model模型想调用工具时harness 按规则决定「放行、询问还是拒绝」。就像进门要过门卫门卫按名单决定你能不能进。Claude Code 提供几种模式default 每个危险操作都问你acceptEdits 自动批准改文件但 shell 大多还要问bypassPermissions 跳过全部检查官方只建议在容器、沙箱里用。你每点一次「Allow」都是权限模型在工作。四、演进为什么以前不需要 Harness四代演进看下来Harness 不是谁一拍脑袋想出来的是模型变强之后的必然。看实战之前先回答一个很自然的问题为什么以前的 AI 不需要 Harness因为模型以前只会「回答」。第 1 代纯 API你发 prompt模型回一段文本。干不干活全看人。第 2 代记忆加 system prompt、RAG模型「记得住背景」可手还是没有。第 3 代Harness给模型工具和循环它开始「动手干活」。第 4 代目标驱动 Loop不光干活还能自己盯着长期任务做完才停。看图 2每一代都解决上一代最痛的问题。有意思的是Anthropic 对 harness 的态度很「反直觉」Less scaffolding, more model——少搭架子多信模型。他们写 Claude Code 时主循环就是最简单的一个 while 循环。Claude Code 负责人 Boris Cherny 甚至说过每六个月删掉你的 CLAUDE.md、skills、hooks 再重新加。脚手架有保质期别把它当成永远有效的护城河。我第一次用 Claude Code 被权限弹窗拦下时才意识到「批准/拒绝」这个动作本身就是 Harness 的一部分——它不只是框架还是一套「谁说了算」的制度。五、实战Claude Code 的 Harness 长什么样Claude Code 不是模型它是一个把 Claude 变成能干活同事的 Harness。光讲原理没意思来点真的。装好 Claude Code在项目目录敲 claude 启动给一句人话任务比如「给这个项目加一个 --verbose 命令行参数跑测试验证」。claude接下来你会看到 harness 自己开工先 Grep 找入口文件在哪Read 读相关代码判断该在哪加改文件前Edit 默认要过权限终端弹出允许/拒绝等你说「Allow」改完自动跑 Bash 测试不行就自己回头再改中途上下文快满了它会提示你压缩把历史总结成摘要继续。全程你要做的就是批准和看结果——你每点一次「Allow」都是权限模型在把关。权限弹窗多了确实烦人我一般给常用命令配规则白名单比如把Bash(git *)加进 allow 列表把小事自动化。注意权限规则是「最严格者胜出」deny ask allow可以精确到某个工具和某段路径。上下文这块我踩过坑有次任务很长我没留意压缩提示等它压缩完发现前期的取舍细节被摘要掉了只能让它重跑一遍。自那以后我养成两个习惯关键信息写进 CLAUDE.md项目记忆文件会话启动自动读入任务太长就拆给子代理——子代理用独立上下文不占主会话窗口。可能有人会问上下文被压缩了关键信息会不会丢压缩前会有提示你也可以用 /compact 指定「保留 X 丢弃 Y」或者 /clear 重开一个干净窗口。真正重要的东西写进 CLAUDE.md 或拆给子代理别全指望上下文记着。六、新玩家DeepSeek Harness v0.1DeepSeek Harness 的意义不是又一个 Claude Code而是第一次把 harness 本身做成了可拆装的产品。如果你以为「Agent Harness」只是 Anthropic 一家的概念那就错过了最近的热点。2026 年 8 月 13 日晚DeepSeek 开源了 DeepSeek Harness v0.1MIT 协议GitHub 仓库 deepseek-ai/deepseek-harness发布半小时星数破万。它想回答一个更大的问题能不能把 harness 变成一台可以自由组装的机器DeepSeek 的答案是「一切皆插件」模型、工具、技能、会话、沙箱、存储甚至 Agent Loop 本身全是插件框架里没有特权组件。想换模型改配置。想加工具装插件。官方默认带 100 多个可单独开关的插件仓库包含 230 个成员包。它预置了四种运行模式本质是四套插件组合模式干什么用标准模式全套工具通用开发PTC 模式模型生成代码编排工具链中间数据不进上下文省 token极简模式只留 Shell 和文件编辑做模型基准测试创造模式让 Agent 检查、改装自己的运行时想试一下很简单一行命令需要 Node 22.19npx deepseek-ai/dsh web # 默认地址 http://127.0.0.1:3080把三个选项摆在一起就看清 Harness 这条赛道的分层了方案核心定位循环与权限上手成本适合谁裸模型 API模型本身全都要你自己写低只调接口生成文本Claude Code极简 harness内置完整低想立刻有人帮写代码DeepSeek Harness可拆装 harness插件化中想自己搭 Agent 产品七、把公式记住Agent Model Harness把「Model Harness Agent」这个公式记住你就拿到了 2026 年 AI 编程所有争论的钥匙。在我看来选型的问题早就不该是「哪个模型最强」而是「哪个 Agent Harness 能让模型把活干得最利索」——Claude Code 把循环做到了极致的简单DeepSeek Harness 则第一次把 harness 本身做成了可拆装的商品。两者都不完美但方向很一致模型负责思考框架负责把活干完。想继续深挖可以去翻 Claude Code 官方术语表搜code.claude.com glossary和 DeepSeek Harness 的 GitHub 仓库搜deepseek-harness前者有「agentic harness」的权威定义后者能看「一切皆插件」的源码。把三个选项摆在一起就看清 Harness 这条赛道的分层了方案核心定位循环与权限上手成本适合谁裸模型 API模型本身全都要你自己写低只调接口生成文本Claude Code极简 harness内置完整低想立刻有人帮写代码DeepSeek Harness可拆装 harness插件化中想自己搭 Agent 产品七、把公式记住Agent Model Harness把「Model Harness Agent」这个公式记住你就拿到了 2026 年 AI 编程所有争论的钥匙。在我看来选型的问题早就不该是「哪个模型最强」而是「哪个 Agent Harness 能让模型把活干得最利索」——Claude Code 把循环做到了极致的简单DeepSeek Harness 则第一次把 harness 本身做成了可拆装的商品。两者都不完美但方向很一致模型负责思考框架负责把活干完。想继续深挖可以去翻 Claude Code 官方术语表搜code.claude.com glossary和 DeepSeek Harness 的 GitHub 仓库搜deepseek-harness前者有「agentic harness」的权威定义后者能看「一切皆插件」的源码。学习资源推荐如果你想更深入地学习大模型以下是一些非常有价值的学习资源这些资源将帮助你从不同角度学习大模型提升你的实践能力。一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取四、AI大模型商业化落地方案作为普通人入局大模型时代需要持续学习和实践不断提高自己的技能和认知水平同时也需要有责任感和伦理意识为人工智能的健康发展贡献力量。
返回列表