ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

UI-TARS Desktop 5分钟快速上手GUI自动化

UI-TARS Desktop 5分钟快速上手GUI自动化 UI-TARS Desktop 5分钟快速上手GUI自动化【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopUI-TARS Desktop 是一个由视觉语言模型驱动的 GUI 自动化桌面应用输入一句自然语言它自己截屏、看懂界面再替你动鼠标键盘。读完这篇你会在自己的机器上把它跑起来完成一个真实的 GUI 操作任务并搞懂权限与模型配置这两个最容易卡住人的环节。旧方案为什么不好用如果你写过 GUI 自动化脚本大概率被这几个问题折磨过要手动定位元素坐标界面布局一变脚本全部作废每个操作系统一套 API跨平台维护成本极高操作失败时看不到程序当时看到了什么调试只能靠猜UI-TARS Desktop 用截图 自然语言替代了坐标脚本模型像人一样看屏幕动作被约束在预定义的动作空间里点击、输入、按键、滚动、结束比自由发挥的模型更稳过程也能逐步回看。所以先跑起来看看效果。环境准备与首次运行系统要求项目要求操作系统macOS / WindowsNode.js20.x 及以上pnpm9.10.0corepack 或 npm 全局安装浏览器Chrome / Edge / Firefox浏览器操作器需要显示器单显示器多显示器可能导致任务失败安装与首次运行最省事的办法是从 Releases 页下载安装包双击安装想用最新代码就自己构建git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install pnpm run dev:ui-tars前三条命令依次完成克隆、装依赖最后一条以开发模式启动 Electron 应用。macOS 上也可以直接brew install --cask ui-tars。macOS 权限配置首次必踩的坑屏幕录制系统设置 → 隐私与安全性 → 屏幕录制不授权截图是黑的模型什么都看不见辅助功能同一路径 → 辅助功能不授权鼠标键盘不会动授权后一定要重启应用否则不生效首次运行后你应该看到什么启动后进入主界面左侧是对话面板中间是实时屏幕预览底部是指令输入区。此时模型还没配置任务还跑不了。视觉语言模型配置GUI 自动化的大脑是 UI-TARS 视觉语言模型可以在 Hugging Face 上自行部署也可以用火山引擎的现成 API。进入设置页填四项VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://xxx/v1/ VLM API KEY: hf_xxx VLM Model Name: tgi两个容易错的点Provider 必须选与模型匹配的选项否则动作解析会失败Base URL 必须以/v1/结尾。填完点 Check Model Availability通过就就绪了。核心能力拆解自然语言指令解析原理模型看到当前截图和你的指令后从受限的动作空间里输出下一步动作点击、输入、按键、滚动、done 等而不是自由生成代码。效果你只写打开 VS Code 开启自动保存它自己拆成一串鼠标键盘动作全程留下逐步截图方便复盘。本地计算机操作器原理通过 nutjs 引擎在桌面发出真实的鼠标键盘事件每一轮循环是截图 → 推理 → 执行 → 等待 → 再截图。效果能操作桌面上任意应用包括没有 DOM 的原生软件。关键配置Loop Wait Time默认 1000ms控制每轮等待时间应用响应慢时建议调大。浏览器操作器原理接管本机 Chrome、Edge 或 Firefox 实例Agent 在真实浏览器窗口里操作页面。效果输入在百度搜 XX 并打开第一个结果它自己拉起浏览器、完成搜索、打开页面全程不用你切窗口。Preset 预设与 HTML 报告原理Preset 是一份设置项的 YAML 打包可从本地文件或 URL 导入URL 预设会在应用启动时自动同步。效果验证过的模型参数打包一份新机器一键导入任务结束后还能把完整过程导出成 HTML 报告直接发给同事复盘。实战演练做官方示例里的一个经典任务在 VS Code 设置里打开自动保存。主界面右上角点新建会话场景选择本地计算机操作器输入指令打开 VS Code 设置开启自动保存并将延迟设置为 500 毫秒点开始后你会看到中间的屏幕预览开始移动它先打开 VS Code再找到设置项逐项修改执行中随时可以接管鼠标人工干预松开后 Agent 会从当前状态继续完成后右侧出现 done 标记全过程每步截图 动作都保留在记录里预期耗时单轮任务全程约 1~3 分钟取决于模型推理速度。第二个可以验证的任务输入在浏览器新标签页搜索 UI-TARS并对结果页截图。完成后点 Export as HTML 导出报告打开它逐步核对截图——每步截图清晰、动作对得上说明视觉识别和执行链路都正常。调优与避坑症状原因最短解法屏幕预览黑屏、识别不到内容macOS 屏幕录制权限未授予隐私与安全性 → 屏幕录制 授权后重启应用发出指令后界面不动辅助功能权限未授予隐私与安全性 → 辅助功能 授权后重启应用Check Model Availability 失败Base URL 未以/v1/结尾或 Provider 不匹配URL 换成/v1/端点Provider 与模型对齐多显示器下任务频繁失败当前仅官方支持单显示器目标应用移到主屏或暂时拔掉第二块屏任务中途卡住、节奏太慢Loop Wait Time默认 1000ms 对慢界面不够调大到 2000长任务同时调高 Max Loop需要更细的排查时用 debug 模式启动会打开远程调试端口cd apps/ui-tars pnpm run debug然后用 Chrome 的 DevTools attach 到应用就能看到渲染过程与事件流。下一步阅读设置配置指南把 VLM / Chat / Operator 参数全部过一遍阅读Preset 管理把验证过的配置打包成 YAML新机器一键导入查看SDK 文档用ui-tars/sdk构建自己的 GUI 自动化 Agent一条npx ui-tars/cli start就能起步浏览 packages/ui-tars/operators/看计算机与浏览器操作器的动作实现模型配好、权限给足之后把重复任务丢给它就行省下的都是时间。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表