自动化与运维 gui-automationcomputer-usescreen-groundingvision-language-modeltransformersglm-4v

CogAgent 图形界面执行器

基于截图与自然语言,为桌面和移动图形界面生成可定位的操作指令。

FollowAgents 评估 · FARS-2.0
待评估
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

CogAgent 是面向 GUI 操作的开源视觉语言模型项目,当前仓库重点提供 CogAgent-9B-20241220。该模型以 GLM-4V-9B 为基础,接收截图、任务描述、历史步骤、平台标记和指定输出格式。它不是连续对话模型,而是在每次执行时依赖传入的历史记录继续完成任务。输出为严格格式的字符串,可包含 Action、Status、Plan、Grounded Operation 以及敏感操作标记;Grounded Operation 会给出操作类型和屏幕坐标框。仓库提供基于 transformers 的命令行推理、网页演示和一个本地部署的 Agent APP 示例,但在线演示仅展示推理结果,不能实际控制计算机。

用户将任务、History steps、平台字段(WIN、Mac 或 Mobile)和格式字段拼接为提示词,并连同截图输入 CogAgent-9B-20241220。模型读取当前屏幕和已执行步骤,返回如 CLICK、TYPE、SCROLL_DOWN 或 RIGHT_CLICK 的 Grounded Operation 字符串,其中 box 标明应执行操作的坐标区域。inference/cli_demo.py 可交互读取图片路径,并把带预测边界框的图片保存为 {your_input_image_name}_{round}.png;inference/web_demo.py 支持连续上传图片进行交互式推理。app/README.md 所述示例用于在配备 GPU 的服务器本地部署模型并执行自动化 GUI 操作。

  1. 在 macOS 14 或 15 上构建截图驱动的本地 GUI 自动化原型的开发者。
  2. 需要让模型根据 Windows 10 或 11 截图生成点击、输入和滚动坐标的研究人员。
  3. 为 Android 13、14 或 15 的图形界面测试收集可解析操作指令的团队。
  4. 希望以“标记所有邮件为已读”这类单步任务验证屏幕定位和操作输出格式的工程师。
  5. 拥有 A100 或 H100 级 GPU,并希望在本地评估 GUI Agent 模型的实验团队。

这个 Agent 有哪些优点和局限?

优点
  • 直接以截图和自然语言任务为输入,并生成含坐标框的 Grounded Operation,便于下游执行器解析。
  • 明确支持 Windows、macOS 和 Android 的平台标记,并支持中文和英文交互。
  • 提供 CLI、网页演示和本地 Agent APP 示例,覆盖模型评估与本地部署入口。
  • 可选择多种严格输出格式,以按需取得状态、计划、动作和敏感操作标记。
局限
  • 模型必须接收图像;纯文本对话无法完成 GUI Agent 任务。
  • 它不是连续对话模型,调用方必须在每轮新会话中传回既往执行历史。
  • BF16 推理至少需要 29GB 显存;SFT 和 LoRA 微调分别有较高的 A100 显存与多卡要求。
  • 项目明确提示无法保证 AI 行为安全,Agent APP 示例仅供学术参考;实际执行 GUI 操作需要自行承担审查与控制责任。

如何安装或部署这个 Agent?

安装 Python 3.10.16 或更高版本后运行:
pip install -r requirements.txt

README 未要求 API 密钥。需要获取模型目录;示例命令使用 THUDM/cogagent-9b-20241220。以 BF16 推理时至少需要 29GB 显存。

如何使用这个 Agent?

准备与目标平台一致的截图后运行:
python inference/cli_demo.py --model_dir THUDM/cogagent-9b-20241220 --platform "Mac" --max_length 4096 --top_k 1 --output_image_path ./results --format_key status_action_op_sensitive

交互时提供图片路径,并按“Task → History steps → Platform → format”的顺序构造提示词。启动网页演示可运行:
python inference/web_demo.py --host 0.0.0.0 --port 7860 --model_dir THUDM/cogagent-9b-20241220 --format_key status_action_op_sensitive --platform "Mac" --output_dir ./results

这个 Agent 与同类方案有什么区别?

项目技术博客将该模型与 GPT-4o-20240806、Claude-3.5-Sonnet、GPT-4o + UGround、GPT-4o + OS-ATLAS,以及 Qwen2-VL、ShowUI、SeeClick 进行 GUI 基准对比。仓库报告其在 Screenspot、OmniAct、CogAgentBench-basic-cn 和 OSWorld 等任务上具有较强结果;这些是项目方报告,采用前应以目标环境复测。

常见问题

是否需要 API 密钥?
仓库提供的本地 transformers 推理命令未列出 API 密钥要求;示例使用模型目录 THUDM/cogagent-9b-20241220。
它能像聊天机器人一样持续对话吗?
不能。模型不支持连续对话,但支持连续执行历史;每次调用应传入此前历史步骤。
在线 Demo 能直接操作我的电脑吗?
不能。在线演示只用于查看模型推理结果;仓库建议本地部署模型。
推理需要多少显存?
README 说明 BF16 推理至少需要 29GB 显存;INT8 约 15GB、INT4 约 8GB,但不建议 INT4,且这些量化方案仅支持 NVIDIA 设备。

相关 Agents