自动化与运维 gui-automationcomputer-usescreen-groundingvision-language-modeltransformersglm-4v

CogAgent 图形界面执行器

基于截图与自然语言,为桌面和移动图形界面生成可定位的操作指令。

FollowAgents 评估 · FARS-2.1
不推荐
42/ 100 五分制 2.1 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全0 / 29 · 0.0/5

证据显示:仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的明确机制。README 仅提及模型输出包含敏感操作标记,但未说明执行时的权限控制或用户确认流程。因此所有信任标准均得 0 分。

2可靠稳定6 / 14 · 2.1/5

证据显示:README 对模型输入输出格式、平台支持、推理成本等描述一致,自洽性得 2 分。依赖列表明确,但未提供版本锁定或完整性校验,依赖可用性得 1 分。失败消息方面,README 未提供错误处理或故障排除指南,仅提示谨慎使用,得 1 分。

3适用触发12 / 18 · 3.3/5

证据显示:README 明确了目标受众(研究人员和开发者)、使用场景(GUI 操作)、能力边界(不支持对话、需要图像输入)以及环境要求(Python 3.10.16+、GPU 内存等),因此各标准得 2 分。

4规范维护11 / 18 · 3.1/5

证据显示:README 结构清晰,包含安装说明、示例、已知限制(如不支持对话、需要图像输入)、许可证(Apache-2.0)和版本信息(20241220)。但缺少明确的变更日志,版本控制信息有限,因此版本控制/变更日志得 1 分,其余得 2 分。

5有效结果9 / 13 · 3.5/5

证据显示:README 提供了详细的输入输出格式和示例,输出可用性得 2 分。模型在 GUI 任务上声称有显著改进,边际价值得 2 分。成本效益方面,提供了推理和微调成本,但未与其他方案比较,得 2 分。

6证据核验4 / 8 · 2.5/5

证据显示:README 引用了论文、技术博客和基准测试,但未提供具体数据或复现步骤,因此声明可追溯性得 2 分。跨来源佐证方面,仅依赖自身声明,未提供独立验证,得 1 分。事实与推断分离方面,README 明确区分了模型能力与推测,得 2 分。

证据充分度: 评估于 2026年8月9日 审查版本 5fde01e4fe52
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 该仓库未提供任何权限控制或用户确认机制,执行 GUI 操作时可能产生不可逆影响,需谨慎使用。
  • 依赖未锁定版本,存在供应链风险,建议使用虚拟环境并固定版本。
  • 模型输出格式严格,解析错误可能导致操作失败,需严格遵循文档。
评估证据 [1][2][3]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

CogAgent 是面向 GUI 操作的开源视觉语言模型项目,当前仓库重点提供 CogAgent-9B-20241220。该模型以 GLM-4V-9B 为基础,接收截图、任务描述、历史步骤、平台标记和指定输出格式。它不是连续对话模型,而是在每次执行时依赖传入的历史记录继续完成任务。输出为严格格式的字符串,可包含 Action、Status、Plan、Grounded Operation 以及敏感操作标记;Grounded Operation 会给出操作类型和屏幕坐标框。仓库提供基于 transformers 的命令行推理、网页演示和一个本地部署的 Agent APP 示例,但在线演示仅展示推理结果,不能实际控制计算机。

用户将任务、History steps、平台字段(WIN、Mac 或 Mobile)和格式字段拼接为提示词,并连同截图输入 CogAgent-9B-20241220。模型读取当前屏幕和已执行步骤,返回如 CLICK、TYPE、SCROLL_DOWN 或 RIGHT_CLICK 的 Grounded Operation 字符串,其中 box 标明应执行操作的坐标区域。inference/cli_demo.py 可交互读取图片路径,并把带预测边界框的图片保存为 {your_input_image_name}_{round}.png;inference/web_demo.py 支持连续上传图片进行交互式推理。app/README.md 所述示例用于在配备 GPU 的服务器本地部署模型并执行自动化 GUI 操作。

  1. 在 macOS 14 或 15 上构建截图驱动的本地 GUI 自动化原型的开发者。
  2. 需要让模型根据 Windows 10 或 11 截图生成点击、输入和滚动坐标的研究人员。
  3. 为 Android 13、14 或 15 的图形界面测试收集可解析操作指令的团队。
  4. 希望以“标记所有邮件为已读”这类单步任务验证屏幕定位和操作输出格式的工程师。
  5. 拥有 A100 或 H100 级 GPU,并希望在本地评估 GUI Agent 模型的实验团队。

这个 Agent 有哪些优点和局限?

优点
  • 直接以截图和自然语言任务为输入,并生成含坐标框的 Grounded Operation,便于下游执行器解析。
  • 明确支持 Windows、macOS 和 Android 的平台标记,并支持中文和英文交互。
  • 提供 CLI、网页演示和本地 Agent APP 示例,覆盖模型评估与本地部署入口。
  • 可选择多种严格输出格式,以按需取得状态、计划、动作和敏感操作标记。
局限
  • 模型必须接收图像;纯文本对话无法完成 GUI Agent 任务。
  • 它不是连续对话模型,调用方必须在每轮新会话中传回既往执行历史。
  • BF16 推理至少需要 29GB 显存;SFT 和 LoRA 微调分别有较高的 A100 显存与多卡要求。
  • 项目明确提示无法保证 AI 行为安全,Agent APP 示例仅供学术参考;实际执行 GUI 操作需要自行承担审查与控制责任。

如何安装或部署这个 Agent?

安装 Python 3.10.16 或更高版本后运行:

pip install -r requirements.txt

README 未要求 API 密钥。需要获取模型目录;示例命令使用 THUDM/cogagent-9b-20241220。以 BF16 推理时至少需要 29GB 显存。

如何使用这个 Agent?

准备与目标平台一致的截图后运行:

python inference/cli_demo.py --model_dir THUDM/cogagent-9b-20241220 --platform "Mac" --max_length 4096 --top_k 1 --output_image_path ./results --format_key status_action_op_sensitive

交互时提供图片路径,并按“Task → History steps → Platform → format”的顺序构造提示词。启动网页演示可运行:

python inference/web_demo.py --host 0.0.0.0 --port 7860 --model_dir THUDM/cogagent-9b-20241220 --format_key status_action_op_sensitive --platform "Mac" --output_dir ./results

这个 Agent 与同类方案有什么区别?

项目技术博客将该模型与 GPT-4o-20240806、Claude-3.5-Sonnet、GPT-4o + UGround、GPT-4o + OS-ATLAS,以及 Qwen2-VL、ShowUI、SeeClick 进行 GUI 基准对比。仓库报告其在 Screenspot、OmniAct、CogAgentBench-basic-cn 和 OSWorld 等任务上具有较强结果;这些是项目方报告,采用前应以目标环境复测。

常见问题

是否需要 API 密钥?
仓库提供的本地 transformers 推理命令未列出 API 密钥要求;示例使用模型目录 THUDM/cogagent-9b-20241220。
它能像聊天机器人一样持续对话吗?
不能。模型不支持连续对话,但支持连续执行历史;每次调用应传入此前历史步骤。
在线 Demo 能直接操作我的电脑吗?
不能。在线演示只用于查看模型推理结果;仓库建议本地部署模型。
推理需要多少显存?
README 说明 BF16 推理至少需要 29GB 显存;INT8 约 15GB、INT4 约 8GB,但不建议 INT4,且这些量化方案仅支持 NVIDIA 设备。

相关 Agents