
UI-TARS Desktop上手指南从安装到用自然语言驱动桌面与浏览器操作【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopUI-TARS Desktop 是一个开源的 GUI Agent 桌面应用基于 UI-TARS 视觉语言模型你用一句中文或英文指令描述需求它通过截屏理解画面自动执行鼠标与键盘操作控制本地计算机或本地浏览器完成图形界面任务。本文覆盖安装、接入模型服务、跑通首个任务、参数调优与预设分发适合希望自动化重复桌面操作的用户以及评估 GUI 自动化的开发者。一个典型任务是这样完成的输入打开 VS Code开启自动保存功能并将延迟设置为 500 毫秒应用截屏模型输出类似点击坐标 (27, 496)的动作执行后再截屏核对循环往复直到任务完成。全过程可以在会话面板里逐步观察。 系统环境与两种获取方式UI-TARS Desktop 支持 macOS 与 Windows目前建议单显示器环境多显示器配置可能导致部分任务失败。项目说明操作系统macOS、Windows显示配置单显示器多屏可能失败浏览器操作模式需预装 Chrome、Edge 或 Firefoxstable / beta / dev / canary 通道均可当前桌面应用版本v0.2.4获取方式有两种到项目 Release 页面下载最新版本的对应平台安装包已安装 Homebrew 的 macOS 用户可直接执行brew install --cask ui-tars如需从源码构建先克隆仓库git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop️ 配置 macOS 辅助功能权限与处理 Windows 安全提示macOS 的准备工作最多因为应用需要系统级的输入与截屏权限。把 UI TARS 图标拖入 Applications 文件夹这是 macOS 的标准安装方式。在系统设置→隐私与安全性中为 UI TARS 开启辅助功能和屏幕录制两项权限。启动应用进入首次打开的欢迎界面。Windows 侧只需一步双击安装程序遇到安全提示时点击仍要运行继续安装。 接入模型服务Hugging Face 或火山引擎两条路线UI-TARS Desktop 不内置模型需要接入一个 OpenAI 兼容接口的视觉语言模型服务。官方给出两条现成路线在 Hugging Face 部署 UI-TARS-1.5-7B或使用火山引擎的 Doubao-1.5-UI-TARS 接口。在 Hugging Face 部署 UI-TARS-1.5-7B在应用内点击Deploy from Hugging Face按钮进入部署流程。选择模型 UI-TARS-1.5-7B按部署教程完成部署后可拿到三样东西Base URL、API Key、Model Name。使用火山引擎 Doubao-1.5-UI-TARS登录火山引擎控制台进入 Doubao-1.5-UI-TARS 模型页点击API 接入。在面板 STEP 1 获取 API KeySTEP 2 切换到 OpenAI SDK 页签读取 Base URL 与模型名Base URL 为https://ark.cn-beijing.volces.com/api/v3模型名为doubao-1.5-ui-tars-250328。填写设置并验证连通性打开设置页左下角齿轮填写五项参数字段说明LanguageVLM 输出语言en或zh默认en只影响模型输出不影响应用界面VLM Provider必须与模型匹配如Hugging Face for UI-TARS-1.5或VolcEngine Ark for Doubao-1.5-UI-TARS该选项决定动作解析格式VLM Base URL模型服务地址Hugging Face 端点必须以/v1/结尾VLM API KEY服务的 API KeyVLM Model Name模型标识填写完成后点击Check Model Availability验证连通性通过后再开始任务。若所用模型支持 Responses API可开启该选项以降低 token 消耗。 跑通第一个任务本地计算机或本地浏览器回到主界面点击New Chat在输入框下方的模式下拉框中选择执行器。模式作用对象适合的任务Computer Use本地计算机桌面应用与文件系统修改软件设置、整理文件Browser Use本地浏览器本机浏览器页面导航、表单填写、数据提取输入指令后回车即可。执行期间右侧面板逐步展示屏幕截图左侧记录模型每一步的推理与动作例如查看 UI-TARS-Desktop 项目最新的 open issue。两点需要留意使用 Browser Use 前确认本机已安装 Chrome、Edge 或 Firefox任务中途想停止时用右上角 Terminate 按钮结束会话并释放资源。另外v0.2.0 曾提供免费的远程 Computer / Browser Operator该服务已于 2025 年 8 月 20 日下线需要远程环境的用户可按 docs/quick-start.md 的说明自行部署。⚙️ 四个直接影响任务成败的参数设置页的 Chat Settings 与 Operator Settings 中有几个参数直接影响成功率与速度默认值即可覆盖多数场景。参数可选范围默认值作用Max Loop25–200100单轮对话最大执行步数复杂任务可调高Loop Wait Time0–3000 ms1000每步截屏前的等待时间页面响应慢时调大Languageen / zhenVLM 输出语言Search EngineGoogle / Bing / BaiduGoogle浏览器模式的默认搜索引擎 用预设批量分发设置并导出执行报告多台机器或团队共用同一套配置时可以用预设preset把设置写成 YAML 文件格式参考 examples/presets/default.yaml在设置页导入本地文件或 URL。本地预设可读写、手动更新URL 预设只读应用每次启动时自动拉取。仓库暂未提供官方远程预设社区可在 examples/presets/ 贡献。任务结束后点击Export as HTML可导出完整执行报告。默认行为是直接下载报告文件如果设置了 Report Storage Base URL一个接收multipart/form-data上传、HTML 文件不超过 30MB 的 HTTP 服务报告会上传并自动把链接复制到剪贴板。下一步通读 docs/quick-start.md按完整流程安装并接入模型查阅 docs/setting.md了解全部 VLM、Chat 与 Report 字段查阅 docs/preset.md掌握预设导入与自动同步机制面向开发者阅读 docs/sdk.md在 Node.js 或 Web 环境用ui-tars/sdk自建 GUI Agent【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考