Open-AutoGLM 手机智能体
让手机自动执行你的自然语言指令,实现多模态屏幕理解与自动化操作。
证据显示:README 明确提到内置敏感操作确认机制,并支持人工接管(Take_over),且提供自定义回调示例,因此 user_confirmation 得 2 分。sensitive_data_handling 得 2 分,因为文档说明在敏感页面(支付、密码、银行)截图会黑屏并自动请求人工接管,体现了对敏感数据的保护。least_privilege 得 1 分,因为文档要求用户开启 USB 调试(安全设置)等权限,但未说明最小权限原则或权限分级。data_flow_transparency 得 1 分,因为文档说明了截图和 ADB 控制流程,但未详细说明数据流向和存储。dependency_security 得 1 分,因为 requirements.txt 列出了依赖但未提供版本锁定或安全审计信息。external_effects 得 1 分,因为文档警告仅限研究使用,但未详细说明可能的外部影响。rollback 得 0 分,因为未提及任何回滚或撤销机制。source_attribution 得 1 分,因为 README 提供了引用论文,但未明确说明代码来源或贡献者。
self_consistency 得 2 分,因为 README 中的命令、配置和 API 示例一致,没有明显矛盾。dependency_availability 得 2 分,因为依赖列表明确,且提供了模型下载链接和第三方服务选项。failure_messages 得 2 分,因为文档提供了常见问题的解决方案,如设备未找到、文本输入不工作等。
audience_and_scenarios 得 2 分,因为文档面向开发者和研究者,提供了多种使用场景(命令行、Python API、远程调试)。capability_boundaries 得 2 分,因为列出了支持的应用和操作,并说明了限制(如敏感页面接管)。trigger_precision 得 2 分,因为任务通过自然语言触发,且提供了 --list-apps 等参数。environment_fit 得 2 分,因为支持 Android、鸿蒙和 iOS,并提供了环境准备指南。
information_architecture 得 2 分,因为 README 结构清晰,包含安装、配置、使用、示例等章节。install_notes 得 2 分,因为提供了详细的安装步骤和依赖说明。naming_stability 得 2 分,因为项目名称和 API 命名一致。examples_and_faq 得 2 分,因为提供了多个示例和常见问题解答。known_limitations 得 2 分,因为文档提到了敏感页面接管、Windows 编码问题等限制。license 得 2 分,因为提供了 Apache-2.0 许可证全文。versioning_changelog 得 1 分,因为未提供版本历史或变更日志。maintenance_responsibility 得 1 分,因为未明确说明维护责任或贡献指南。
output_usability 得 2 分,因为输出格式清晰,提供了 verbose 模式输出示例。marginal_value 得 2 分,因为提供了自动化手机操作的价值,且支持多种应用。cost_benefit 得 2 分,因为提供了第三方服务和本地部署两种选项,用户可根据成本选择。
claim_traceability 得 2 分,因为 README 中的声明(如支持 50+ 应用)有具体列表支持。cross_source_corroboration 得 1 分,因为仅依赖 README,未提供其他来源验证。fact_inference_separation 得 2 分,因为文档区分了事实(如支持的应用)和推断(如预期输出)。
- 该框架需要用户授予 ADB 调试权限,可能带来安全风险,请确保仅在可信设备上使用。
- 文档未提供版本历史或变更日志,建议关注项目更新。
- 依赖未锁定版本,可能存在供应链风险。
- 远程调试功能可能增加攻击面,请谨慎使用。
这个 Agent 能做什么,适合哪些场景?
Open-AutoGLM 是一个开源的手机智能体框架,它通过 ADB 或 HDC 控制 Android 或 HarmonyOS 设备,使用视觉语言模型理解屏幕内容,并结合规划能力自动执行用户用自然语言描述的任务。系统支持多模态屏幕感知、自动生成操作流程、敏感操作确认和人工接管,还提供远程调试能力。该仓库包含模型服务部署选项(本地或云端)、命令行和 Python API 接口,并预置了 50+ 款主流中文应用和 60+ 款鸿蒙应用的支持。该框架适合研究和教育用途,并有明确的非商业使用条款。
读取用户自然语言指令(如“打开美团搜索附近的火锅店”),使用 AutoGLM 系列视觉语言模型(如 AutoGLM-Phone-9B)解析屏幕截图并输出动作序列,然后通过 ADB 或 HDC 在真实设备上执行点击、滑动、输入等操作,直到任务完成。它提供命令行接口(main.py)、Python API(PhoneAgent 类)、交互式和单次任务模式,并支持自定义回调(如敏感操作确认、人工接管)、远程连接、多设备管理(--device-id)和可配置的 system prompt(中英文)。它还集成了 Midscene.js 等自动化工具,并提供了模型部署指南(vLLM/SGLang)和第三方服务(智谱 BigModel、ModelScope)的使用方法。
- 开发者在 Android 设备上自动化测试应用 UI 流程,如自动注册、登录和下单。
- 个人用户想通过自然语言指令操作手机,如在美团上搜索附近餐厅并比价。
- 测试人员需要对鸿蒙设备进行自动化验证,使用 HDC 控制执行重复性任务。
- 研究人员希望基于 AutoGLM 模型复现或改进手机智能体算法。
- 企业想将手机操作集成到工作流中,比如自动从微信收集信息并填写表格。
- 远程场景下,运维人员通过 WiFi 连接到无人值守的 Android 设备进行任务自动化。
这个 Agent 有哪些优点和局限?
- 支持多平台设备(Android 和 HarmonyOS),使用标准调试工具 ADB/HDC,易于接入。
- 提供开源模型(AutoGLM-Phone-9B),可在本地部署,也有第三方服务可选,降低使用门槛。
- 内置敏感操作确认和人工接管机制,增强安全性和可控性。
- 支持远程调试(WiFi/网络),无需 USB 连接,便于无人值守场景。
- 预置 50+ 中文应用和 60+ 鸿蒙应用,开箱即用。
- 需要手动安装和配置 ADB/HDC、ADB Keyboard,对非技术用户有一定门槛。
- 模型服务依赖要么使用第三方 API(有成本),要么需要高性能 GPU 本地部署(显存 24GB+)。
- 目前仅有官方提供的模型服务,未提供其他模型适配,锁定于 AutoGLM 系列。
- 文档主要面向研究和学习,用途受限,禁止用于非法活动,可能不适合商业合规要求。
- 对鸿蒙设备的支持需要特定 HDC 工具和 HarmonyOS NEXT 版本,限制较窄。
如何安装或部署这个 Agent?
- 克隆仓库:git clone https://github.com/zai-org/Open-AutoGLM.git && cd Open-AutoGLM 2. 安装依赖:pip install -r requirements.txt && pip install -e . 3. 准备设备:在 Android 7.0+ 或 HarmonyOS 设备上启用开发者模式和 USB 调试,连接电脑。Android 需要安装并启用 ADB Keyboard。4. 配置模型服务:使用智谱 BigModel(--base-url https://open.bigmodel.cn/api/paas/v4 --model autoglm-phone)或 ModelScope(--base-url https://api-inference.modelscope.cn/v1 --model ZhipuAI/AutoGLM-Phone-9B),或本地部署 vLLM/SGLang 服务。
如何使用这个 Agent?
确保模型服务启动后,使用以下命令执行任务:python main.py --base-url http://localhost:8000/v1 --model autoglm-phone-9b "打开微信搜索文件传输助手发送消息:部署成功"。也可使用交互模式(不带任务参数),通过 --lang en 使用英文提示,--device-type hdc 控制鸿蒙设备,--device-id 指定特定设备。Python API 用法:from phone_agent import PhoneAgent; agent = PhoneAgent(model_config); result = agent.run("打开淘宝搜索无线耳机")。