Mobile-Agent:多平台GUI智能体系列
由阿里通义实验室推出的强大图形界面智能体系列,支持手机、桌面与网页的自动化操作。
证据显示仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有信任相关标准均未得到支持,因此得分为0。
self_consistency: 1 - README中多个版本(v1, v2, v3, v3.5)和模型系列(GUI-Owl)的命名和描述基本一致,但缺少详细的架构文档,一致性证据有限。dependency_availability: 1 - 提供了HuggingFace和ModelScope的模型权重链接,但未提供依赖列表或安装验证。failure_messages: 0 - 未提供错误处理或失败消息的文档。
audience_and_scenarios: 2 - README明确面向研究人员和开发者,并展示了手机、PC、Web等多种场景的演示。capability_boundaries: 1 - 描述了各版本的能力,但未明确边界或限制。trigger_precision: 0 - 未提供触发机制或指令解析的细节。environment_fit: 1 - 提到了云手机和在线demo,但未提供本地部署的环境要求。
information_architecture: 2 - README结构清晰,包含新闻、结果、特性、系列工作、演示、引用等部分。install_notes: 1 - 未提供明确的安装步骤,仅提及在线demo和API。naming_stability: 2 - 版本命名一致(v1, v2, v3, v3.5),模型系列命名清晰。examples_and_faq: 2 - 提供了多个视频演示和示例任务,但无FAQ。known_limitations: 1 - 未明确列出已知限制,仅在新闻中提及部分版本。license: 2 - 提供MIT许可证。versioning_changelog: 1 - 有新闻更新,但无正式变更日志。maintenance_responsibility: 2 - 明确标注了Alibaba Group和Tongyi Lab,并提供了联系方式。
output_usability: 1 - 演示视频展示了输出,但未提供输出格式或集成指南。marginal_value: 2 - 提供了多个版本和模型,覆盖多种场景,具有研究价值。cost_benefit: 1 - 未提供性能基准或资源消耗数据,难以评估成本效益。
claim_traceability: 2 - 提供了论文链接和模型权重,可追溯。cross_source_corroboration: 1 - 仅依赖自身仓库,未提供第三方验证。fact_inference_separation: 1 - 新闻和结果部分混合了事实和推断,未明确区分。
- 仓库未提供任何安全或权限相关的文档,使用前需自行评估风险。
- 依赖和安装说明不完整,可能影响可复现性。
- 未明确已知限制,可能隐藏潜在问题。
这个 Agent 能做什么,适合哪些场景?
Mobile-Agent是阿里通义实验室发布的多平台图形用户界面(GUI)智能体家族,涵盖多个版本:从单智能体的Mobile-Agent-v1,到多智能体协作的v2,再到跨平台的v3及最新的v3.5。项目提供自研的GUI感知与操作模型GUI-Owl(含1.5系列),并发布在HuggingFace和ModelScope上。所有代码以MIT协议开源,支持Android、PC、Web等环境,提供在线演示与API服务。系列工作多次被NeurIPS、ICLR等顶会接收,并获得最佳演示奖。
Mobile-Agent读取屏幕截图和GUI元素信息,通过多模态大模型(如Qwen3-VL)进行感知、定位和决策,输出操作指令(如点击、滑动、输入等),控制手机或PC完成用户任务。它支持多智能体框架,包含规划、进度管理、反思与记忆等功能。具体组件包括:GUI-Owl模型(提供GUI感知、grounding和端到端操作)、Mobile-Agent-v3.5(多平台基础GUI智能体)、PC-Agent(层次化多智能体框架)、UI-S1(半在线强化学习)、GUI-Critic-R1(术前错误诊断)等。提供了ModelScope和阿里云百炼的在线演示与API。
- 个人用户:用自然语言指令让AI帮你完成手机上的跨应用操作,例如查询航班、对比价格、管理日程。
- 办公人员:在PC和Web环境中,使用AI自动创建文档、搜索信息、操作办公软件(如WPS、Edge)。
- 开发者:利用GUI-Owl模型和Mobile-Agent框架,构建自定义的GUI自动化工具或研究多模态智能体。
- 企业用户:通过阿里云百炼的API集成,在云手机或云桌面环境中部署自动化服务。
- 研究人员:基于提供的代码、数据集和模型,复现或改进GUI自动化、强化学习等方法。
- 测试人员:对移动或PC应用进行自动化UI测试,减少手工操作成本。
这个 Agent 有哪些优点和局限?
- 功能全面:覆盖手机、PC、Web多平台,且提供多种模型尺寸(2B至235B)和Instruct/Thinking版本。
- 性能领先:在20多个GUI基准上达到SOTA结果,并开源了评估代码。
- 学术认可:多个版本被NeurIPS、ICLR等顶会接收,并获得最佳演示奖。
- 有在线演示和API,便于快速体验和集成。
- 依赖阿里云生态:部分演示和API基于ModelScope和Bailian,可能需要阿里云账号。
- 硬件要求高:运行大模型需要较高GPU显存(如32B模型)。
- 文档分散:不同版本的安装和配置说明分散在各子目录,需要自行查阅。
- 部分功能(如视频演示)依赖未明确的开源程度,实际部署可能需要额外配置。
如何安装或部署这个 Agent?
安装步骤因版本而异,通常需要克隆仓库并安装依赖:\n``bash\ngit clone https://github.com/X-PLUG/MobileAgent\ncd MobileAgent\n# 根据具体子目录的README安装依赖,例如Mobile-Agent-v3.5\n``\n需要Python环境、PyTorch、CUDA,以及(可选)GPU。模型权重从HuggingFace或ModelScope下载。
如何使用这个 Agent?
参考各版本子目录的README。基本用法是:加载GUI-Owl模型,然后运行主脚本,传入自然语言指令。例如,在Mobile-Agent-v3.5目录下,使用模型API或本地推理,启动智能体后输入任务描述。也可以使用在线demo:ModelScope(https://modelscope.cn/studios/MobileAgentTest/computer_use)和阿里云百炼(https://bailian.console.aliyun.com/next?tab=demohouse#/experience/adk-computer-use/pc)。