尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

跑通一个超越人类的 GUI 智能体:Agent-S3 的完整部署与调优路径

跑通一个超越人类的 GUI 智能体:Agent-S3 的完整部署与调优路径 跑通一个超越人类的 GUI 智能体Agent-S3 的完整部署与调优路径【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S你大概也被问过这事为什么不让程序自己干比如把散落在收件箱里的三百个附件按项目归档或者把 Word 里所有表格统一改成公司模板样式。手动做费时专门写脚本更烦——因为很多操作的入口只是屏幕上那个窗口而不是 API。这就是 GUI 智能体框架 Agent-S3 要解决的问题让模型像人一样看屏幕、点鼠标、敲键盘把复杂任务一步步做完。它在 OSWorld 基准上的最新成绩是 72.6%刚好越过人类参考线约 72%。GUI 智能体能接住什么样的任务先用两个具体场景说清楚它和什么有关。场景一表格类办公任务。打开 sales_data.xlsx算出各产品线的季度环比增长再画一张趋势图。在 Agent-S3 的内部规则里电子表格的计算走代码 agent直接写 Python 执行画图走 GUI点菜单、选图表类型。这个分工不是你去配置的而是内置在框架的程序性记忆里你读一眼 程序性记忆源码 就能看到它是怎么写进提示词的。场景二跨应用流程。把这周的会议记录从日历里导出整理成一份 Markdown 存到共享盘。这类任务没有现成 API 可调最稳的自动化路线就是操作 GUI——人怎么点它怎么点。Agent-S3 支持 Linux、macOS、Windows单显示器如果打开本地代码执行环境它还能直接在你机器上跑 Python/Bash把一部分GUI 活变成程序活这是它区别于纯多模态智能体方案的关键点。内部怎么运转从一张截图到一次点击 用餐厅后厨的分工来理解最直观Worker 是头灶它拿到指令和最新截图输出一条描述性动作比如点击右上角的保存按钮。它只说点什么不管点在哪。Grounding 是传菜员兼刀工把点保存按钮翻译成可执行的 Python 代码——先由 Grounding 模型如 UI-TARS在截图上定位按钮的像素坐标再由 pyautogui 真正执行点击。执行完截一张新图送回给头灶循环往复直到任务完成。在这个闭环外面还有两样东西。记忆是灶台笔记每次任务结束都会沉淀经验——哪类任务该走代码 agent、哪类必须走 GUI、完成后怎么验证这些会作为程序性记忆注入下一轮。Reflection 是试味员默认开启在 Worker 跑偏时拉一把。值得一提的是 S3 相对 S2 最大的变化砍掉了上层 Manager 分层Worker 一个环节直接完成规划 执行推理步骤更少、对环境变化反应更快。翻 AgentS3 核心源码类注释就一句话——no hierarchy for less inference time。图中展示了 GUI 智能体一次任务执行的完整闭环计划流向 Worker描述性动作经 Grounding 变成代码执行经验写回 Memory十分钟跑起来三个前置条件一台单屏机器、主模型的 API Key、一个能部署 Grounding 模型的推理端点官方推荐把 UI-TARS-1.5-7B 挂在 Hugging Face Inference Endpoints 上自己用 vLLM 起也完全可以。安装部分只有三行pip install gui-agents brew install tesseract # OCR 依赖必须装 export OPENAI_API_KEY你的key # 用其他厂商则换对应 key装好后用自带 CLI 直接跑这就是最常见的 Agent-S3 部署姿势agent_s \ --provider openai \ --model gpt-5-2025-08-07 \ --ground_provider huggingface \ --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 \ --grounding_height 1080想改源码的话clone 仓库https://gitcode.com/GitHub_Trending/ag/Agent-S后pip install -e .进入开发模式即可。不用 CLI 时SDK 的用法是实例化AgentS3OSWorldACI然后在循环里调agent.predict(instruction, obs)、执行返回的 action 代码官方 CLI 源码里就有完整的推理循环可以参考。主模型与 Grounding 模型怎么配GUI 智能体的配置其实只围绕两个大脑展开配置项推荐值说明主模型gpt-5-2025-08-07负责规划与决策OpenAI、Anthropic、Gemini、Azure、Open Router、本地 vLLM 都支持Grounding 模型UI-TARS-1.5-7B自己部署在推理端点上负责在截图中定位 UI 元素Grounding 分辨率1920×1080必须与模型输出坐标系一致换 UI-TARS-72B 则用 1000×1000物理屏幕单屏1920×1080不支持多屏本地代码执行默认关--enable_local_env开启后以你的用户权限跑任意代码仅可信环境使用轨迹长度8--max_trajectory_length历史保留的截图轮数越大上下文越长踩过的坑提前说grounding_width/grounding_height如果和 Grounding 模型的输出坐标系对不上点击坐标会整体错位表现就是智能体到处乱点。这是部署阶段排障的第一嫌疑官方文档里对两种 UI-TARS 模型都有明确的坐标对照。GUI 智能体的强项与短板看数据先说强的。OSWorld 基准100 步设置上Agent-S3 单次运行 66.0%已经比前 SOTAGTA1 w/ GPT-563.4%高 2.6 个百分点再叠加 Behavior Best-of-N跑三次、用裁判挑最优轨迹到 72.6%越过 OSWorld 人类参考线约 72%。方法OSWorld 成功率提升幅度 vs 第二名Agent S3bBoN72.6%9.2 ppAgent S3 单次运行66.0%2.6 ppGTA1 w/ GPT-5前 SOTA63.4%—人类参考~72%—图中展示了各 GUI 智能体在 OSWorld 基准上的成功率以及 Agent-S3 与约 72% 人类参考线的相对位置泛化性也值得一提没有做任何平台专项适配WindowsAgentArena 上从单次的 50.2% 提升到 3 次采样择优后的 56.6%AndroidWorld 从 68.1% 到 71.6%。再说不好听的部署前得知道72.6% 是择优分数。单次运行是 66%如果你的推理预算只够跑一遍评估和排期都应该按 66% 算别按 72.6% 算。Grounding 模型要自己部署。7B 不算大但仍然意味着一块推理端点的显存和运维成本不像纯 API 方案那样零部署。本地代码执行是双刃剑。它用运行 agent 的同一用户权限执行 Python/Bash官方警告写得很大仅限可信环境。生产环境请放进沙箱并给 bash 设超时框架内建 30 秒限制但别依赖它。另外一个隐性成本长序列设置下成功率更高但模型调用次数和 token 消耗也同步上涨性能换算力的账要自己算。图中展示了允许步数从 15 步增加到 50 步时各智能体成功率的变化序列越长 Agent-S3 的领先越明显三种可以复用的任务套路跑一段时间之后你会发现真正值得沉淀的不是某个具体任务而是三种套路。GUI 与代码分工视觉活给 GUI画图、透视表、打印设置、一切必须点菜单的操作。数据活给代码 agent求和、批量填充、筛选排序、批量改格式。Agent-S3 内部就是按这条线切分的而且明确规定图表类操作永远不走代码 agent——你自己设计自动化流水线时可以直接照抄这条边界。异常回退与验证代码 agent 的返回只有三种状态DONE、FAIL、BUDGET_EXHAUSTED。框架内建的规则是代码 agent 改完文件后必须回到 GUI 里打开应用验证结果而且当前打开着的应用可能不反映磁盘上的变化——要整个关掉重开刷新页面不够。这套代码干活、GUI 验收、失败回退到 GUI 手动收尾的组合是这篇文档里我认为最值得抄走的一段工程实践。关键任务跑多次择优失败代价高的任务上 bBoN 路线同一任务跑 3 次为每条轨迹的截图变化生成事实描述再用裁判模型挑出最优的一条。仓库里带完整工具链osworld_setup/s3/bbon/下的 generate_facts 和 run_judge 就是干这个的。66% 到 72.6%、50.2% 到 56.6%都是这一招抬上去的。下一步值得关注S3 论文The Unreasonable Effectiveness of Scaling Agents for Computer Use已公开S2 被 COLM 2025 接收S1 被 ICLR 2025 接收这条 GUI 智能体路线在学术侧是持续出活的。值得盯的两个方向一是 bBoN 裁判的工程化——目前它更多是评测工具离自动重试到成功的生产组件还有一段距离二是单次运行的成本——性能上探的空间和推理成本下探的空间目前是反向的谁先解决谁就赢。速查卡项内容安装pip install gui-agents 单独装 tesseract开发模式clone https://gitcode.com/GitHub_Trending/ag/Agent-S 后pip install -e .推荐主模型gpt-5-2025-08-07OpenAI推荐 GroundingUI-TARS-1.5-7B自部署端点坐标 1920×1080常用开关--enable_local_env/--max_trajectory_length 8/--enable_reflection坑一Grounding 分辨率与模型坐标系不匹配 → 点击全错位坑二多屏或非 1080p → 坐标偏移框架只支持单屏安全红线本地代码环境执行任意代码默认关闭生产上沙箱运行评测资产osworld_setup/s3/ 内含完整运行脚本与 bBoN 裁判工具【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表