AssetOpsBench 工业运维智能体基准

用 MCP 将工业资产数据、预测模型与维护流程连接为可评测的智能体工作流。

Star 数
★ 2.3k
最近更新
6 天前
License
Apache-2.0
主语言
Python

30 秒速览

可在哪里用
通用 · 跨平台OpenAI API · Claude API
开始前需要
Python with pipShell / 命令行网络访问本地文件系统MCP Server
典型场景
维护工程师需要查询 MAIN 站点内的资产或某台 Chiller 已安装、已测量的传感器时,可通过 IoT MCP 服务组织查询。
主要局限
README 的本地场景命令标注为“to be enabled”,首个可验证的命令行运行路径尚不完整。

这个 Agent 能做什么,适合哪些场景?

AssetOpsBench 是面向工业资产运行与维护的开源框架和基准,用于构建、编排及评估领域智能体。项目提供 IoT、FMSR、TSFM、工单和振动等 MCP 服务,以及覆盖多步骤工业工作流的可复现场景和评估管线。README 标示其覆盖 9 类资产、141+ 个场景、5 个领域智能体与两种编排框架。可选框架包括可配合任意 LLM 的 Plan Execute、带子智能体与虚拟文件系统的 Deep Agent,以及分别面向 Claude 和 OpenAI 模型的 ReAct 编排器。它的交付边界是本地 Python 包和 MCP 服务器;README 也链接了 Hugging Face 数据集、交互式 Playground 与 Colab 示例。

系统通过 MCP 调用工业数据与分析能力:IoT 服务可调用 sites、asset_ids、asset_detail、assets、find_assets_by_sensors、installed_sensors 和 measured_sensors;FMSR 提供 get_failure_modes、generate_failure_modes、add_failure_modes;TSFM 提供任务、时序画像、模型/特征检索、配方运行、评估及运行结果查询能力。TSFM MCP 接口包含 41 个工具,涵盖模型卡、特征卡、配方执行、评估与结果/运行记录检索。Plan Execute 按计划顺序执行工作流;Deep Agent 支持规划、子智能体和虚拟文件系统;Claude Agent 与 OpenAI Agent 采用 ReAct 和“智能体作为工具”的委派方式。示例任务包括列出 MAIN 站点资产、查询泵的失效模式、为 Chiller 6 查找预测模型并检查其可加载性,以及为异常检测生成工单。

  1. 维护工程师需要查询 MAIN 站点内的资产或某台 Chiller 已安装、已测量的传感器时,可通过 IoT MCP 服务组织查询。
  2. 可靠性工程师要为泵类设备核查既有失效模式,或生成并添加失效模式记录时,可使用 FMSR 服务。
  3. 数据科学家要为 Chiller 6 寻找预测模型、分析时间序列质量和特征,并运行配方及评估时,可使用 TSFM 服务。
  4. 设施运维人员在检测到 Chiller 6 异常后需要生成后续工单时,可将工单领域能力纳入工作流。
  5. 研究人员需要比较大语言模型在工业多步骤任务中的轨迹表现时,可使用项目的场景、评估管线与六维评分描述。

如何安装或部署这个 Agent?

README 支持的安装方式为:

git clone https://github.com/IBM/AssetOpsBench.git
cd AssetOpsBench
pip install -e .

这要求本机具备可运行 python 与 pip 的 Python 环境。README 指向 INSTRUCTIONS.md 作为 MCP 服务器和 plan-execute runner 的完整配置说明;所给材料未列出模型 API 凭证、环境变量或各 MCP 服务的具体启动参数。

如何使用这个 Agent?

README 给出的场景命令为:

python -m assetopsbench.run --scenario "List all sensors of Chiller 6 in MAIN site"

但该命令在 README 中标为“to be enabled”,因此不能把它视为已确认可用的首个本地运行命令。可审计的替代入口是 README 所链接的 Colab(LLM Agent 示例)和 Hugging Face Playground;本地 MCP 配置与实际 plan-execute 运行步骤需依照 INSTRUCTIONS.md,而所给材料未包含其内容。

这个 Agent 有哪些优点和局限?

优点
  • 将 IoT、失效模式、时序模型/特征、工单和振动分析暴露为 MCP 能力,适合跨系统的工业运维任务。
  • TSFM 服务明确提供从时间序列画像、模型发现到配方运行与评估、结果追溯的完整接口面,并列出 41 个工具。
  • 同时提供 Plan Execute、Deep Agent、Claude Agent 和 OpenAI Agent,覆盖顺序执行、长程任务与 agent-as-tool 委派等不同执行模式。
  • 提供可复现场景和评估管线,并说明以 6 个维度评估推理、执行和数据处理。
局限
  • README 的本地场景命令标注为“to be enabled”,首个可验证的命令行运行路径尚不完整。
  • MCP 服务启动、模型 API 凭证、环境变量和具体依赖版本需查看未随材料提供的 INSTRUCTIONS.md,增加落地前的验证工作。
  • 项目聚焦工业资产运维和模拟工业环境;对通用办公、客服或非工业领域并无已给出的适配证据。
  • 部分编排器明确依赖 Claude 或 OpenAI 模型,采用这些路径时会引入相应模型提供方依赖。

这个 Agent 与同类方案有什么区别?

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
AssetOpsBench 工业运维智能体基准 当前 50 · 缺口较多 ★ 2.3k 6 天前 Python OpenAI API · Claude API
Safari MCP 78 · 表现良好 ★ 205 今天 JavaScript Claude Code · Claude.ai
Nuphus 桌面自动化 MCP 72 · 存在缺口 ★ 308 7 天前 Rust Claude.ai · OpenAI API · Claude API
Keinsaas Navigator 69 · 存在缺口 ★ 1.2k 1 个月前 TypeScript OpenAI API · Claude API

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
50/ 100 五分制 2.5 / 5
信任安全 8/29
可靠稳定 6/14
适用触发 14/18
规范维护 11/18
有效结果 7/13
证据核验 4/8
查看各维度的扣分理由
信任安全8 / 29 · 1.4/5

证据显示:存在secret-scan工作流(gitleaks/trufflehog)和couchdb数据文件守卫,表明对敏感数据和依赖安全有一定关注;但未发现用户确认机制(默认bypassPermissions)、数据流透明性文档、回滚机制或明确的权限最小化设计。扣分:用户确认缺失、回滚缺失、权限最小化证据不足。

可靠稳定6 / 14 · 2.1/5

证据显示:有单元测试(test_runner.py)覆盖ClaudeAgentRunner,且README和pyproject.toml一致;但依赖版本部分固定(litellm==1.94.0),部分宽松(>=),且未提供失败消息的明确设计。扣分:依赖可用性未充分验证,失败消息文档不足。

适用触发14 / 18 · 3.9/5

证据显示:README详细描述了多种场景(IoT、FMSR、TSFM、WO)、多个agent框架和MCP服务器,受众明确;但能力边界和触发精度仅部分说明(如TSFM工具列表),环境适配(如MCP配置)依赖INSTRUCTIONS.md未提供。扣分:能力边界和触发精度证据不足。

规范维护11 / 18 · 3.1/5

证据显示:有README、LICENSE(Apache-2.0)、pyproject.toml、安装说明(pip install -e .)、示例场景和贡献指南;但缺少明确的版本变更日志、已知限制部分和命名稳定性说明。扣分:版本变更日志和已知限制缺失。

有效结果7 / 13 · 2.7/5

证据显示:输出为AgentResult和Trajectory,有评估管道(LLM Judge),边际价值体现在多场景和多agent框架;但成本效益分析(如API成本、运行时间)未提供。扣分:成本效益证据不足。

证据核验4 / 8 · 2.5/5

证据显示:README引用了论文、数据集、竞赛和多个外部链接,可追溯性较好;但事实与推断的分离(如基准结果)未明确说明。扣分:事实与推断分离不足。

风险与缓解建议
  • 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 默认权限模式为bypassPermissions,可能执行任意工具调用,需用户确认或限制。
  • 依赖版本部分未固定,可能引入不兼容或安全风险。
  • 缺少明确的回滚机制和数据流透明性文档。
  • 基准结果和竞赛声明缺乏独立验证,需谨慎引用。
证据充分度:低 评估于 2026年8月9日 审查版本 e11d1c1b2022 评估后仓库已有新提交,评分可能未覆盖最新改动
查看完整评分方法 →

常见问题

它能连接哪些工业数据与操作?
README 明确列出 IoT 资产与传感器查询、FMSR 失效模式操作、TSFM 时序模型和特征工作流、工单能力,以及振动分析能力。
是否只支持某一家模型提供商?
不是。Plan Execute 被描述为可与任意 LLM 配合;同时项目明确提供 Claude Agent 和 OpenAI Agent 两个特定编排器。
能否立即用 README 的 CLI 跑一个场景?
不能据此确认:唯一给出的 python -m assetopsbench.run 示例被标为“to be enabled”。
评估覆盖什么?
项目提供面向多步骤工业工作流的场景和评估管线;README 说明轨迹由 LLM Judge 评分,并采用 6 个维度衡量推理、执行和数据处理。
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents