AssetOpsBench 工业运维智能体基准
用 MCP 将工业资产数据、预测模型与维护流程连接为可评测的智能体工作流。
- Star 数
- ★ 2.3k
- 最近更新
- 6 天前
- License
- Apache-2.0
- 主语言
- Python
- FA 评分
- 50/100 · 缺口较多
30 秒速览
- 可在哪里用
- 通用 · 跨平台OpenAI API · Claude API
- 开始前需要
- 典型场景
- 维护工程师需要查询 MAIN 站点内的资产或某台 Chiller 已安装、已测量的传感器时,可通过 IoT MCP 服务组织查询。
- 主要局限
- README 的本地场景命令标注为“to be enabled”,首个可验证的命令行运行路径尚不完整。
这个 Agent 能做什么,适合哪些场景?
AssetOpsBench 是面向工业资产运行与维护的开源框架和基准,用于构建、编排及评估领域智能体。项目提供 IoT、FMSR、TSFM、工单和振动等 MCP 服务,以及覆盖多步骤工业工作流的可复现场景和评估管线。README 标示其覆盖 9 类资产、141+ 个场景、5 个领域智能体与两种编排框架。可选框架包括可配合任意 LLM 的 Plan Execute、带子智能体与虚拟文件系统的 Deep Agent,以及分别面向 Claude 和 OpenAI 模型的 ReAct 编排器。它的交付边界是本地 Python 包和 MCP 服务器;README 也链接了 Hugging Face 数据集、交互式 Playground 与 Colab 示例。
系统通过 MCP 调用工业数据与分析能力:IoT 服务可调用 sites、asset_ids、asset_detail、assets、find_assets_by_sensors、installed_sensors 和 measured_sensors;FMSR 提供 get_failure_modes、generate_failure_modes、add_failure_modes;TSFM 提供任务、时序画像、模型/特征检索、配方运行、评估及运行结果查询能力。TSFM MCP 接口包含 41 个工具,涵盖模型卡、特征卡、配方执行、评估与结果/运行记录检索。Plan Execute 按计划顺序执行工作流;Deep Agent 支持规划、子智能体和虚拟文件系统;Claude Agent 与 OpenAI Agent 采用 ReAct 和“智能体作为工具”的委派方式。示例任务包括列出 MAIN 站点资产、查询泵的失效模式、为 Chiller 6 查找预测模型并检查其可加载性,以及为异常检测生成工单。
- 维护工程师需要查询 MAIN 站点内的资产或某台 Chiller 已安装、已测量的传感器时,可通过 IoT MCP 服务组织查询。
- 可靠性工程师要为泵类设备核查既有失效模式,或生成并添加失效模式记录时,可使用 FMSR 服务。
- 数据科学家要为 Chiller 6 寻找预测模型、分析时间序列质量和特征,并运行配方及评估时,可使用 TSFM 服务。
- 设施运维人员在检测到 Chiller 6 异常后需要生成后续工单时,可将工单领域能力纳入工作流。
- 研究人员需要比较大语言模型在工业多步骤任务中的轨迹表现时,可使用项目的场景、评估管线与六维评分描述。
如何安装或部署这个 Agent?
README 支持的安装方式为:
git clone https://github.com/IBM/AssetOpsBench.git
cd AssetOpsBench
pip install -e .这要求本机具备可运行 python 与 pip 的 Python 环境。README 指向 INSTRUCTIONS.md 作为 MCP 服务器和 plan-execute runner 的完整配置说明;所给材料未列出模型 API 凭证、环境变量或各 MCP 服务的具体启动参数。
如何使用这个 Agent?
README 给出的场景命令为:
python -m assetopsbench.run --scenario "List all sensors of Chiller 6 in MAIN site"但该命令在 README 中标为“to be enabled”,因此不能把它视为已确认可用的首个本地运行命令。可审计的替代入口是 README 所链接的 Colab(LLM Agent 示例)和 Hugging Face Playground;本地 MCP 配置与实际 plan-execute 运行步骤需依照 INSTRUCTIONS.md,而所给材料未包含其内容。
这个 Agent 有哪些优点和局限?
- 将 IoT、失效模式、时序模型/特征、工单和振动分析暴露为 MCP 能力,适合跨系统的工业运维任务。
- TSFM 服务明确提供从时间序列画像、模型发现到配方运行与评估、结果追溯的完整接口面,并列出 41 个工具。
- 同时提供 Plan Execute、Deep Agent、Claude Agent 和 OpenAI Agent,覆盖顺序执行、长程任务与 agent-as-tool 委派等不同执行模式。
- 提供可复现场景和评估管线,并说明以 6 个维度评估推理、执行和数据处理。
- README 的本地场景命令标注为“to be enabled”,首个可验证的命令行运行路径尚不完整。
- MCP 服务启动、模型 API 凭证、环境变量和具体依赖版本需查看未随材料提供的
INSTRUCTIONS.md,增加落地前的验证工作。 - 项目聚焦工业资产运维和模拟工业环境;对通用办公、客服或非工业领域并无已给出的适配证据。
- 部分编排器明确依赖 Claude 或 OpenAI 模型,采用这些路径时会引入相应模型提供方依赖。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| AssetOpsBench 工业运维智能体基准 当前 | 50 · 缺口较多 | ★ 2.3k | 6 天前 | Python | OpenAI API · Claude API |
| Safari MCP | 78 · 表现良好 | ★ 205 | 今天 | JavaScript | Claude Code · Claude.ai |
| Nuphus 桌面自动化 MCP | 72 · 存在缺口 | ★ 308 | 7 天前 | Rust | Claude.ai · OpenAI API · Claude API |
| Keinsaas Navigator | 69 · 存在缺口 | ★ 1.2k | 1 个月前 | TypeScript | OpenAI API · Claude API |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:存在secret-scan工作流(gitleaks/trufflehog)和couchdb数据文件守卫,表明对敏感数据和依赖安全有一定关注;但未发现用户确认机制(默认bypassPermissions)、数据流透明性文档、回滚机制或明确的权限最小化设计。扣分:用户确认缺失、回滚缺失、权限最小化证据不足。
证据显示:有单元测试(test_runner.py)覆盖ClaudeAgentRunner,且README和pyproject.toml一致;但依赖版本部分固定(litellm==1.94.0),部分宽松(>=),且未提供失败消息的明确设计。扣分:依赖可用性未充分验证,失败消息文档不足。
证据显示:README详细描述了多种场景(IoT、FMSR、TSFM、WO)、多个agent框架和MCP服务器,受众明确;但能力边界和触发精度仅部分说明(如TSFM工具列表),环境适配(如MCP配置)依赖INSTRUCTIONS.md未提供。扣分:能力边界和触发精度证据不足。
证据显示:有README、LICENSE(Apache-2.0)、pyproject.toml、安装说明(pip install -e .)、示例场景和贡献指南;但缺少明确的版本变更日志、已知限制部分和命名稳定性说明。扣分:版本变更日志和已知限制缺失。
证据显示:输出为AgentResult和Trajectory,有评估管道(LLM Judge),边际价值体现在多场景和多agent框架;但成本效益分析(如API成本、运行时间)未提供。扣分:成本效益证据不足。
证据显示:README引用了论文、数据集、竞赛和多个外部链接,可追溯性较好;但事实与推断的分离(如基准结果)未明确说明。扣分:事实与推断分离不足。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 默认权限模式为bypassPermissions,可能执行任意工具调用,需用户确认或限制。
- 依赖版本部分未固定,可能引入不兼容或安全风险。
- 缺少明确的回滚机制和数据流透明性文档。
- 基准结果和竞赛声明缺乏独立验证,需谨慎引用。
常见问题
它能连接哪些工业数据与操作?
是否只支持某一家模型提供商?
能否立即用 README 的 CLI 跑一个场景?
python -m assetopsbench.run 示例被标为“to be enabled”。