CogAgent 图形界面执行器
基于截图与自然语言,为桌面和移动图形界面生成可定位的操作指令。
这个 Agent 能做什么,适合哪些场景?
CogAgent 是面向 GUI 操作的开源视觉语言模型项目,当前仓库重点提供 CogAgent-9B-20241220。该模型以 GLM-4V-9B 为基础,接收截图、任务描述、历史步骤、平台标记和指定输出格式。它不是连续对话模型,而是在每次执行时依赖传入的历史记录继续完成任务。输出为严格格式的字符串,可包含 Action、Status、Plan、Grounded Operation 以及敏感操作标记;Grounded Operation 会给出操作类型和屏幕坐标框。仓库提供基于 transformers 的命令行推理、网页演示和一个本地部署的 Agent APP 示例,但在线演示仅展示推理结果,不能实际控制计算机。
用户将任务、History steps、平台字段(WIN、Mac 或 Mobile)和格式字段拼接为提示词,并连同截图输入 CogAgent-9B-20241220。模型读取当前屏幕和已执行步骤,返回如 CLICK、TYPE、SCROLL_DOWN 或 RIGHT_CLICK 的 Grounded Operation 字符串,其中 box 标明应执行操作的坐标区域。inference/cli_demo.py 可交互读取图片路径,并把带预测边界框的图片保存为 {your_input_image_name}_{round}.png;inference/web_demo.py 支持连续上传图片进行交互式推理。app/README.md 所述示例用于在配备 GPU 的服务器本地部署模型并执行自动化 GUI 操作。
- 在 macOS 14 或 15 上构建截图驱动的本地 GUI 自动化原型的开发者。
- 需要让模型根据 Windows 10 或 11 截图生成点击、输入和滚动坐标的研究人员。
- 为 Android 13、14 或 15 的图形界面测试收集可解析操作指令的团队。
- 希望以“标记所有邮件为已读”这类单步任务验证屏幕定位和操作输出格式的工程师。
- 拥有 A100 或 H100 级 GPU,并希望在本地评估 GUI Agent 模型的实验团队。
这个 Agent 有哪些优点和局限?
- 直接以截图和自然语言任务为输入,并生成含坐标框的 Grounded Operation,便于下游执行器解析。
- 明确支持 Windows、macOS 和 Android 的平台标记,并支持中文和英文交互。
- 提供 CLI、网页演示和本地 Agent APP 示例,覆盖模型评估与本地部署入口。
- 可选择多种严格输出格式,以按需取得状态、计划、动作和敏感操作标记。
- 模型必须接收图像;纯文本对话无法完成 GUI Agent 任务。
- 它不是连续对话模型,调用方必须在每轮新会话中传回既往执行历史。
- BF16 推理至少需要 29GB 显存;SFT 和 LoRA 微调分别有较高的 A100 显存与多卡要求。
- 项目明确提示无法保证 AI 行为安全,Agent APP 示例仅供学术参考;实际执行 GUI 操作需要自行承担审查与控制责任。
如何安装或部署这个 Agent?
安装 Python 3.10.16 或更高版本后运行:
pip install -r requirements.txt
README 未要求 API 密钥。需要获取模型目录;示例命令使用 THUDM/cogagent-9b-20241220。以 BF16 推理时至少需要 29GB 显存。
如何使用这个 Agent?
准备与目标平台一致的截图后运行:
python inference/cli_demo.py --model_dir THUDM/cogagent-9b-20241220 --platform "Mac" --max_length 4096 --top_k 1 --output_image_path ./results --format_key status_action_op_sensitive
交互时提供图片路径,并按“Task → History steps → Platform → format”的顺序构造提示词。启动网页演示可运行:
python inference/web_demo.py --host 0.0.0.0 --port 7860 --model_dir THUDM/cogagent-9b-20241220 --format_key status_action_op_sensitive --platform "Mac" --output_dir ./results
这个 Agent 与同类方案有什么区别?
项目技术博客将该模型与 GPT-4o-20240806、Claude-3.5-Sonnet、GPT-4o + UGround、GPT-4o + OS-ATLAS,以及 Qwen2-VL、ShowUI、SeeClick 进行 GUI 基准对比。仓库报告其在 Screenspot、OmniAct、CogAgentBench-basic-cn 和 OSWorld 等任务上具有较强结果;这些是项目方报告,采用前应以目标环境复测。