)
UI-TARS 完整教程一句话任务多模态 GUI 智能体替你看完屏幕、点完按钮含部署与坐标处理【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS让视觉模型点击确认按钮它多半只回一句确认按钮在屏幕中间——给不出像素坐标自动化链路还得靠你自己写规则。UI-TARS 是字节跳动开源的多模态 GUI 智能体截图进Thought Action 出坐标可以直接解析成可执行脚本把看图说话变成看图动手。项目说明是什么开源多模态 GUI 智能体 UI-TARS-1.5 系列 配套解析包 ui-tars给谁用想做桌面/移动端自动化、屏幕元素定位评测的开发者与研究者交付物OpenAI 兼容推理端点 可直接运行的 pyautogui 脚本怎么开始pip install ui-tars再按部署文档起一个 7B 端点版本线先记一下1.5-7B 于 2025 年 4 月开源2025 年 9 月发布的 UI-TARS-2 把能力面扩到 GUI、Game、Code、Tool Use 四个方向。 最短路径先跑通一次解析再碰推理端点两条命令把仓库和解析包都拿下来git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARSpip install ui-tars第一条是项目仓库里面带着真实对话样例、坐标教程和提示词模板第二条是独立解析包v0.1.4要求 Python ≥3.10。README 的 quick start 流程把一行模型输出形如Thought: Click the buttonAction: click(start_box(100,200))喂给parse_action_to_structure_output参数照抄示例factor1000、原图 1920×1080、model_typeqwen25vl得到带 action_type、thought、action_inputs 的结构化字典再交给parsing_response_to_pyautogui_code产出按真实图像尺寸缩放好坐标的 pyautogui 代码串。这一步不需要 GPU先验证输出 → 动作这条链路比先搭推理服务省心得多。场景一起一个能推理的 7B 端点想让模型看真实截图并回坐标官方推荐云部署细节在 README_deploy.md在 Hugging Face Inference Endpoints 里选UI-TARS 1.5 7B硬件选 GPU L40S 1GPU 48GL4、A100 也行。容器三个参数Max Input Length 65536、Max Batch Prefill Tokens 65536、Max Tokens 65537环境变量必加两个——CUDA_GRAPHS0避免部署失败、PAYLOAD_LIMIT8000000防止大图请求挂掉最后把容器镜像切到 text-generation-inference:3.2.1 再应用。起好后用 OpenAI SDK 直接调temperature0.0、max_tokens400、流式。预期输出就是两行Thought 按计划语言可指定中文写推理Action 给一个函数调用。值得记住的细节部署文档里每个配置项都挂了对应的 issue 编号排错时知道先查哪条。场景二模型输出如何变成 pyautogui 脚本你拿到的是文本需要的是真实鼠标动作。桌面动作空间固定 9 种click、left_double、right_single、drag、hotkey、type、scroll、wait、finished。不用自己写正则codes/ui_tars/action_parser.py 的解析器会把 start_point/end_point、point等格式变体统一掉再翻译成 pyautogui 调用。两个值得知道的默认行为type 默认走剪贴板粘贴input_swapTrue而不是逐字符敲中文和长文本更稳finished 被转成 DONE方便你写智能体循环的退出条件场景三三种提示词模板怎么选同一个模型设备不同提示词就换一套三份模板都在 codes/ui_tars/prompt.pyCOMPUTER_USEWindows / Linux / macOS 桌面覆盖单击、双击、右键、拖拽、快捷键、文本输入、滚动适合浏览器导航和办公软件操作MOBILE_USE给 Android 模拟器/手机多了 long_press、open_app、press_home、press_back适合启动应用和填表单GROUNDING只输出 click、只给 Action 不给 Thought专门做定位能力评测和模型训练判断标准一句话你的截图来自什么设备。场景四坐标点不准官方有专门教程基于 Qwen 2.5-VL 的模型输出的是相对缩放后图像的绝对坐标必须映射回原图截图。这是集成时最容易踩的坑README_coordinates.md 讲得很细smart_resize 把宽高对齐到 28 的倍数IMAGE_FACTOR28总像素数卡在 100×28×28 到 16384×28×28 之间宽高比上限 200输出坐标除以缩放后尺寸归一化再乘回原图尺寸仓库里还配了可视化素材在一张 1920×1080 的截图上把模型想点的位置标成红点点没点对一眼就知道。 UI-TARS 与VLM 手写规则的本质区别端到端截图进、坐标出不依赖 DOM 和可访问性树任何有像素的界面都能操作——这是它能玩游戏的根本原因14 个 Poki 网页游戏里 13 个拿了 100 分先想后做强化学习注入了思考链Minecraft 200 任务平均 0.42带 Thought对 0.35不带此前 SOTA 是 0.32小模型能打开源 1.5-7B 在 OSWorld 上 27.5高于自家 72B-DPO 的 24.6完整版 1.5 拿 42.5100 步此前 SOTA 38.1 要用 200 步定位是招牌ScreenSpotPro 61.6OpenAI CUA 只有 23.4Claude 3.7 是 27.7ScreenSpot-V2 上 94.2输出可校验固定函数调用格式能解析、能回放、能审计也说句公道话WebVoyager 84.8略输 CUA 的 87浏览器场景不是全线领先。⚠️ 什么时候别用它纯浏览器场景 → 项目自己推荐去看浏览器自动化项目 Midscene只想在本地电脑直接跑 → 用 UI-TARS-desktop开源的 7B 没有针对游戏场景优化游戏能力上完整版 1.5 仍有明显优势会幻觉在陌生或歧义界面可能误判元素、采取错误动作算力成本7B 上云端端点也要 48G 级 GPU滥用风险能绕过验证码生产环境要谨慎最不适合要求 100% 确定性、每一步可审计的操作场景从口头描述到坐标落点从问 AI 看屏幕它只给你口头描述到坐标直接落在正确像素上这是 UI-TARS 带来的变化。第一步就做这个克隆仓库、pip install ui-tars按 README 跑一遍解析示例确认坐标红点落对位置再去动推理端点。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考