TARS 多模态操作栈
用视觉模型和自然语言操作电脑、浏览器及外部 MCP 工具。
这个 Agent 能做什么,适合哪些场景?
TARS 是一个多模态 AI Agent 栈,当前包含 Agent TARS 与 UI-TARS Desktop 两个项目。Agent TARS 提供 CLI 和 Web UI,可在终端、电脑、浏览器及产品环境中执行任务,并可使用 GUI、DOM 或混合方式控制浏览器。其内核基于 MCP,可挂载 MCP Server 连接现实工具,并通过协议驱动的 Event Stream 支持上下文工程和 Agent UI。UI-TARS Desktop 是由 UI-TARS 与 Seed-1.5-VL/1.6 系列模型驱动的原生 GUI Agent,提供本地及远程的电脑和浏览器操作能力。桌面端声明支持 Windows、macOS 和浏览器,包含截图识别、鼠标键盘控制与实时状态反馈。
用户可通过 npx @agent-tars/cli@latest 启动 Agent TARS,或以 agent-tars --provider ... --model ... --apiKey ... 运行指定模型提供商。它接收自然语言任务,结合 GUI Agent、视觉能力,以及浏览器的 visual grounding、DOM 或混合控制策略来执行操作;也可挂载 MCP Servers 调用外部工具。运行过程由 Event Stream 驱动,面向上下文工程和 Agent UI 传递数据流。UI-TARS Desktop 则将自然语言指令转化为本地或远程电脑、浏览器中的截图识别、鼠标与键盘操作,并显示实时反馈和状态。
- 需要在终端中调用多模态模型、并以 CLI 或 Web UI 执行任务的开发者。
- 需要让自动化流程在浏览器中结合页面视觉信息与 DOM 信息操作网页的团队。
- 需要把天气、图表等外部服务接入任务流,并通过 MCP Server 生成结果的用户。
- 希望用自然语言调整 VS Code 设置(如启用自动保存并设置延迟)的桌面用户。
- 需要让 GUI Agent 在本地或远程浏览器中查看 GitHub 项目最新开放议题的用户。
这个 Agent 有哪些优点和局限?
- 同一代码库同时提供 Agent TARS 的 CLI/Web UI 与 UI-TARS Desktop 的原生 GUI 操作路径。
- 浏览器控制明确支持 visual grounding、DOM 及混合策略,而非只依赖单一交互方式。
- MCP 是内核基础能力,可挂载 MCP Servers 连接外部工具。
- 桌面端明确列出截图与视觉识别、精确鼠标键盘控制及实时状态显示。
- CLI 的全局安装要求 Node.js 22 或更高版本。
- 已给出的运行示例需要模型提供商和 API Key;材料未说明其他提供商的配置方式。
- UI-TARS Desktop 的快速开始文档内容未提供,无法核验安装、模型获取与启动细节。
- 桌面端虽声明“完全本地处理”,但所给材料未说明权限机制、失败恢复或安全边界的技术实现。
如何安装或部署这个 Agent?
安装 Agent TARS CLI 需要 Node.js 22 或更高版本。可直接运行:npx @agent-tars/cli@latest;或全局安装:npm install @agent-tars/cli@latest -g。UI-TARS Desktop 的 README 仅指向 docs/quick-start.md,但所提供材料未包含该文件内容,因此无法据此给出可核验的桌面端安装命令。
如何使用这个 Agent?
准备相应提供商的 API Key 后,可运行例如:agent-tars --provider volcengine --model doubao-1-5-thinking-vision-pro-250428 --apiKey your-api-key,或 agent-tars --provider anthropic --model claude-3-7-sonnet-latest --apiKey your-api-key。随后以自然语言描述任务,Agent TARS 可采用浏览器 GUI、DOM 或混合策略,并可配置 MCP Servers。桌面端支持本地与远程电脑、浏览器操作,但提供的材料没有给出其启动、模型配置或远程会话的具体步骤。
这个 Agent 与同类方案有什么区别?
仓库将 UI-TARS Desktop 定位为原生桌面 GUI Agent,并在“use in browser”位置列出 Midscene;所给材料没有提供两者的功能或性能对比。