自动化与运维 gui-automationmultimodalmobile-automationdesktop-automationweb-automationreinforcement-learningmodelscopealiyun-bailian

Mobile-Agent:多平台GUI智能体系列

由阿里通义实验室推出的强大图形界面智能体系列,支持手机、桌面与网页的自动化操作。

FollowAgents 评估 · FARS-2.1
不推荐
29/ 100 五分制 1.5 / 5
1 2 3 4 5 6
1信任安全0 / 29 · 0.0/5

证据显示仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有信任相关标准均未得到支持,因此得分为0。

2可靠稳定3 / 14 · 1.1/5

self_consistency: 1 - README中多个版本(v1, v2, v3, v3.5)和模型系列(GUI-Owl)的命名和描述基本一致,但缺少详细的架构文档,一致性证据有限。dependency_availability: 1 - 提供了HuggingFace和ModelScope的模型权重链接,但未提供依赖列表或安装验证。failure_messages: 0 - 未提供错误处理或失败消息的文档。

3适用触发6 / 18 · 1.7/5

audience_and_scenarios: 2 - README明确面向研究人员和开发者,并展示了手机、PC、Web等多种场景的演示。capability_boundaries: 1 - 描述了各版本的能力,但未明确边界或限制。trigger_precision: 0 - 未提供触发机制或指令解析的细节。environment_fit: 1 - 提到了云手机和在线demo,但未提供本地部署的环境要求。

4规范维护10 / 18 · 2.8/5

information_architecture: 2 - README结构清晰,包含新闻、结果、特性、系列工作、演示、引用等部分。install_notes: 1 - 未提供明确的安装步骤,仅提及在线demo和API。naming_stability: 2 - 版本命名一致(v1, v2, v3, v3.5),模型系列命名清晰。examples_and_faq: 2 - 提供了多个视频演示和示例任务,但无FAQ。known_limitations: 1 - 未明确列出已知限制,仅在新闻中提及部分版本。license: 2 - 提供MIT许可证。versioning_changelog: 1 - 有新闻更新,但无正式变更日志。maintenance_responsibility: 2 - 明确标注了Alibaba Group和Tongyi Lab,并提供了联系方式。

5有效结果6 / 13 · 2.3/5

output_usability: 1 - 演示视频展示了输出,但未提供输出格式或集成指南。marginal_value: 2 - 提供了多个版本和模型,覆盖多种场景,具有研究价值。cost_benefit: 1 - 未提供性能基准或资源消耗数据,难以评估成本效益。

6证据核验4 / 8 · 2.5/5

claim_traceability: 2 - 提供了论文链接和模型权重,可追溯。cross_source_corroboration: 1 - 仅依赖自身仓库,未提供第三方验证。fact_inference_separation: 1 - 新闻和结果部分混合了事实和推断,未明确区分。

证据充分度: 评估于 2026年8月9日 审查版本 11cea575561f
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 仓库未提供任何安全或权限相关的文档,使用前需自行评估风险。
  • 依赖和安装说明不完整,可能影响可复现性。
  • 未明确已知限制,可能隐藏潜在问题。
评估证据 [1][2]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Mobile-Agent是阿里通义实验室发布的多平台图形用户界面(GUI)智能体家族,涵盖多个版本:从单智能体的Mobile-Agent-v1,到多智能体协作的v2,再到跨平台的v3及最新的v3.5。项目提供自研的GUI感知与操作模型GUI-Owl(含1.5系列),并发布在HuggingFace和ModelScope上。所有代码以MIT协议开源,支持Android、PC、Web等环境,提供在线演示与API服务。系列工作多次被NeurIPS、ICLR等顶会接收,并获得最佳演示奖。

Mobile-Agent读取屏幕截图和GUI元素信息,通过多模态大模型(如Qwen3-VL)进行感知、定位和决策,输出操作指令(如点击、滑动、输入等),控制手机或PC完成用户任务。它支持多智能体框架,包含规划、进度管理、反思与记忆等功能。具体组件包括:GUI-Owl模型(提供GUI感知、grounding和端到端操作)、Mobile-Agent-v3.5(多平台基础GUI智能体)、PC-Agent(层次化多智能体框架)、UI-S1(半在线强化学习)、GUI-Critic-R1(术前错误诊断)等。提供了ModelScope和阿里云百炼的在线演示与API。

  1. 个人用户:用自然语言指令让AI帮你完成手机上的跨应用操作,例如查询航班、对比价格、管理日程。
  2. 办公人员:在PC和Web环境中,使用AI自动创建文档、搜索信息、操作办公软件(如WPS、Edge)。
  3. 开发者:利用GUI-Owl模型和Mobile-Agent框架,构建自定义的GUI自动化工具或研究多模态智能体。
  4. 企业用户:通过阿里云百炼的API集成,在云手机或云桌面环境中部署自动化服务。
  5. 研究人员:基于提供的代码、数据集和模型,复现或改进GUI自动化、强化学习等方法。
  6. 测试人员:对移动或PC应用进行自动化UI测试,减少手工操作成本。

这个 Agent 有哪些优点和局限?

优点
  • 功能全面:覆盖手机、PC、Web多平台,且提供多种模型尺寸(2B至235B)和Instruct/Thinking版本。
  • 性能领先:在20多个GUI基准上达到SOTA结果,并开源了评估代码。
  • 学术认可:多个版本被NeurIPS、ICLR等顶会接收,并获得最佳演示奖。
  • 有在线演示和API,便于快速体验和集成。
局限
  • 依赖阿里云生态:部分演示和API基于ModelScope和Bailian,可能需要阿里云账号。
  • 硬件要求高:运行大模型需要较高GPU显存(如32B模型)。
  • 文档分散:不同版本的安装和配置说明分散在各子目录,需要自行查阅。
  • 部分功能(如视频演示)依赖未明确的开源程度,实际部署可能需要额外配置。

如何安装或部署这个 Agent?

安装步骤因版本而异,通常需要克隆仓库并安装依赖:\n``bash\ngit clone https://github.com/X-PLUG/MobileAgent\ncd MobileAgent\n# 根据具体子目录的README安装依赖,例如Mobile-Agent-v3.5\n``\n需要Python环境、PyTorch、CUDA,以及(可选)GPU。模型权重从HuggingFace或ModelScope下载。

如何使用这个 Agent?

参考各版本子目录的README。基本用法是:加载GUI-Owl模型,然后运行主脚本,传入自然语言指令。例如,在Mobile-Agent-v3.5目录下,使用模型API或本地推理,启动智能体后输入任务描述。也可以使用在线demo:ModelScope(https://modelscope.cn/studios/MobileAgentTest/computer_use)和阿里云百炼(https://bailian.console.aliyun.com/next?tab=demohouse#/experience/adk-computer-use/pc)。

常见问题

Mobile-Agent需要哪些硬件配置?
至少需要带有足够显存的GPU(如20GB以上)来运行7B或更大模型。具体取决于模型尺寸和量化。
是否可以使用自己的GUI模型?
框架是模块化的,理论上可以替换为其他多模态模型,但需要适配接口。
是否支持Windows桌面自动化?
PC-Agent和Mobile-Agent-v3.5支持PC操作,但可能需要特定设置(如远程桌面)。
在线API的收费标准?
百炼上的API可能收费,请参考阿里云官方文档。开源版本可以自行部署。

相关 Agents