Open Computer Use(E2B 云桌面)
用开源模型在隔离云桌面中执行键盘、鼠标和命令操作。
- Star 数
- ★ 2.3k
- 最近更新
- 2 个月前
- License
- Apache-2.0
- 主语言
- Python
- FA 评分
- 0/100 · 缺口较多
30 秒速览
- 可在哪里用
- 平台专用OpenAI API · Claude API
- 开始前需要
- 典型场景
- 需要在隔离云端 Ubuntu 桌面中让模型执行键盘、鼠标及命令操作的开发者。
- 主要局限
- 核心执行环境依赖 E2B Desktop Sandbox,采用前需要 E2B API key。
这个 Agent 能做什么,适合哪些场景?
Open Computer Use 是一个由开源大语言模型控制的云端 Linux 电脑,运行在 E2B Desktop Sandbox 上。它通过键盘、鼠标和 shell 命令操作沙箱,并将沙箱显示画面实时流式传输到客户端。项目提供网页界面,用户可以随时暂停代理并补充提示。默认使用 Ubuntu,但项目说明其设计目标是支持其他操作系统。模型选择在 os_computer_use/config.py 中配置,providers.py 提供多家模型服务商及 OS-Atlas、ShowUI 的接入。
启动后,代理接收用户提示,在 E2B Desktop Sandbox 提供的云端 Linux 环境中执行键盘、鼠标和 shell 命令操作,并向客户端直播该桌面的显示画面。用户可在执行期间暂停并再次提示代理。模型配置位于 os_computer_use/config.py,例如 grounding_model 可设为 providers.OSAtlasProvider(),vision_model 和 action_model 可设为 providers.GroqProvider("llama3.2")、providers.GroqProvider("llama3.3")。providers.py 所列支持路径覆盖 Fireworks、OpenRouter、Llama API、Groq、DeepSeek、Google、OpenAI、Anthropic、HuggingFace Spaces、Moonshot 和 Mistral AI。
- 需要在隔离云端 Ubuntu 桌面中让模型执行键盘、鼠标及命令操作的开发者。
- 想通过实时桌面画面观察并随时暂停 AI 电脑操作的用户。
- 需要在 config.py 中切换 Groq、OpenAI、Anthropic、Gemini 或其他已列服务商模型的团队。
- 希望以 OS-Atlas 或 ShowUI 作为 grounding 模型进行电脑操作实验的研究者。
- 希望从命令行带入首条任务提示、例如让代理使用网页浏览器查询旧金山天气的用户。
如何安装或部署这个 Agent?
前提条件为 Python 3.10 或更高版本、git、E2B API key,以及所选 LLM 服务商的 API key。在终端安装 Poetry 和 ffmpeg:brew install poetry ffmpeg。随后运行 git clone https://github.com/e2b-dev/open-computer-use/,进入目录 cd open-computer-use,创建 .env 并设置 E2B_API_KEY="your-e2b-api-key"。再按 config.py 中选择的服务商设置对应密钥,例如 GROQ_API_KEY、OPENAI_API_KEY 或 ANTHROPIC_API_KEY;使用 HuggingFace Spaces 时还需提供 HF_TOKEN 以绕过 Gradio 速率限制。最后运行 poetry install。
如何使用这个 Agent?
在项目目录执行 poetry run start 启动网页界面;程序会打开并请求第一条指令。若要直接传入任务,执行 poetry run start --prompt "use the web browser to get the current weather in sf"。启动数秒后应可看到沙箱显示流。可在 os_computer_use/config.py 调整 grounding_model、vision_model 和 action_model,并确保 .env 中存在所选服务商的密钥。
这个 Agent 有哪些优点和局限?
- 以 E2B Desktop Sandbox 提供隔离的云端 Linux 桌面,并把桌面显示实时流式传输到客户端。
- 同一代理可通过 config.py 组合 grounding、vision 与 action 模型,而非限定单一模型服务商。
- 除主流 API 服务商外,还明确列出 OS-Atlas 和 ShowUI 的 grounding 接入。
- 执行期间允许用户暂停并追加提示,便于人工介入。
- 核心执行环境依赖 E2B Desktop Sandbox,采用前需要 E2B API key。
- 除 HuggingFace Spaces 外,所选模型服务商通常需要单独 API key,带来账户、计费和密钥管理成本。
- 文档的安装命令使用 brew,并将 Poetry 与 ffmpeg 列为前置依赖;其他安装环境的具体步骤未在所给资料中说明。
- 尽管设计目标是支持其他操作系统,已明确说明的运行系统是 Ubuntu,其他系统的配置与兼容性没有给出。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| Open Computer Use(E2B 云桌面) 当前 | 0 · 缺口较多 | ★ 2.3k | 2 个月前 | Python | OpenAI API · Claude API |
| Clawd Cursor | 74 · 存在缺口 | ★ 403 | 今天 | TypeScript | Codex · Claude Code |
| Hermes Agent | 67 · 存在缺口 | ★ 248k | 今天 | Python | OpenAI API |
| macOS Harness | 55 · 缺口较多 | ★ 886 | 1 个月前 | Python | Codex · Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据不足:仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的文档或实现。所有标准均因缺乏证据而扣分。
证据不足:未提供自一致性、依赖可用性或失败消息的文档或实现。所有标准均因缺乏证据而扣分。
证据不足:未提供目标受众、能力边界、触发精度或环境适配的文档。所有标准均因缺乏证据而扣分。
证据不足:信息架构、安装说明、命名稳定性、示例/FAQ、已知限制、许可证、版本控制/变更日志或维护责任均未充分记录。许可证文件存在但未在 README 中明确说明。所有标准均因缺乏证据而扣分。
证据不足:未提供输出可用性、边际价值或成本效益的文档。所有标准均因缺乏证据而扣分。
证据不足:未提供声明可追溯性、跨来源佐证或事实/推断分离的文档。所有标准均因缺乏证据而扣分。
- 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
- 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
- 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
- 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
- 仓库未提供安全或权限控制文档,使用前需自行评估风险。
- 未提供用户确认机制,代理可能执行未经确认的操作。
- 依赖项未进行安全审计,存在潜在漏洞风险。
- 未提供回滚或恢复机制,操作失败可能无法撤销。