自动化与运维 multi-agent-coordinationgraph-executionfailure-recoveryhuman-in-the-looplitellmmcp-integrationbrowser-use

Hive 智能体运行框架

为长期、多步骤业务流程提供多智能体编排、状态恢复与人工监管的生产运行层。

FollowAgents 评估 · FARS-2.1
不推荐
46/ 100 五分制 2.3 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全10 / 29 · 1.7/5

证据显示:README 提到加密凭证存储、环境变量配置、安全最佳实践(SECURITY.md),以及人类介入节点(human-in-the-loop)。但未提供具体实现细节,如权限最小化、用户确认流程、数据流透明性、敏感数据处理的具体机制。依赖安全方面,SECURITY.md 提到输入验证、CORS、速率限制,但未提供依赖审计或漏洞管理证据。外部影响方面,README 提到浏览器使用和工具集成,但未明确权限边界。回滚方面,提到检查点恢复,但未提供具体回滚机制。来源归属方面,未提供明确的来源追踪机制。因此,各标准得分较低,因为证据多为断言而非实现细节。

2可靠稳定6 / 14 · 2.1/5

证据显示:README 描述了一致的架构(图执行、状态管理、故障恢复),但未提供具体实现或测试证据。依赖可用性方面,提到 uv 工作区和依赖管理,但未提供依赖锁定或可用性保证。失败消息方面,提到故障恢复和自愈,但未提供具体错误消息设计。因此,自一致性得 2 分,因为描述一致;依赖可用性和失败消息得 1 分,因为缺乏具体证据。

3适用触发10 / 18 · 2.8/5

证据显示:README 明确了目标受众(生产团队)和场景(长运行工作流、多代理协调),并提供了快速入门和示例。能力边界方面,提到支持多种 LLM 和工具,但未明确限制。触发精度方面,提到自然语言目标生成图,但未提供精确触发机制。环境适配方面,提到支持 Windows、macOS、Linux,以及本地模型。因此,受众和场景、能力边界、环境适配得 2 分,触发精度得 1 分。

4规范维护10 / 18 · 2.8/5

证据显示:README 提供了清晰的信息架构(文档链接、快速入门、FAQ),安装说明详细(quickstart 脚本),许可证明确(Apache-2.0),维护责任明确(贡献指南、社区支持)。但命名稳定性未明确,已知限制未列出,版本变更日志未提供。因此,信息架构、安装说明、示例和 FAQ、许可证、维护责任得 2 分,命名稳定性、已知限制、版本变更日志得 1 分。

5有效结果7 / 13 · 2.7/5

证据显示:README 描述了输出可用性(可观察性、审计跟踪),边际价值(生产级 harness),但成本效益未提供具体数据。因此,输出可用性和边际价值得 2 分,成本效益得 1 分。

6证据核验3 / 8 · 1.9/5

证据显示:README 中的声明(如生产级、自愈)未提供可验证的证据,如基准测试或案例研究。跨来源佐证方面,未提供外部验证。事实与推断分离方面,未明确区分。因此,各标准得 1 分。

证据充分度: 评估于 2026年8月9日 审查版本 3c390c9e6ca3
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 发布者身份未经验证,应视为未知,不要基于品牌信任。
  • README 中的功能声明(如生产级、自愈)缺乏可验证的测试或基准证据。
  • 安全功能(如加密凭证存储、权限控制)仅提及,未提供实现细节,需审查代码。
  • 依赖安全未提供审计或漏洞管理证据,需检查依赖锁定和更新策略。
  • 外部工具集成(如浏览器使用)可能带来权限风险,需明确边界。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Hive 是一个以 Python 构建的多智能体执行运行框架,面向需要将智能体从原型推进到生产环境的团队。用户用自然语言描述目标后,系统会生成图式智能体工作流、连接代码和测试用例,并由 Worker 执行节点任务。其框架包含图执行、角色记忆、会话隔离、检查点式崩溃恢复、成本控制与实时可观测性等能力。它通过 MCP 连接 CRM、支持、消息、数据、文件及内部 API 等业务系统,并可接入浏览器使用能力。项目可通过脚本在自有基础设施上启动,使用 LiteLLM 兼容路径支持多家模型提供商。

通过主页输入框提交目标后,Queen 会与用户澄清需求;Coding Agent 生成 agent graph、连接代码和测试用例。framework 中的核心运行时和 graph executor 协调并行任务,SDK-wrapped nodes 以工具访问和可观测性执行,Control Plane 监控指标、预算与策略。执行未通过时,系统按文档描述捕获失败、evolve graph 并重新部署;需要人工决策时,intervention nodes 会暂停执行,等待输入或按超时与升级策略处理。quickstart 脚本会建立 framework 与 aden_tools 环境、加密凭据存储和默认模型配置,并打开 Hive 界面。

  1. 运营团队需要把一个会跨多个步骤、持续较长时间的业务流程交给多个并行执行单元,同时保留状态和恢复能力。
  2. 负责客户支持或 CRM 自动化的团队,需要通过 MCP 将智能体工作流连接到现有消息、数据和内部 API 系统。
  3. 平台工程团队需要为生产智能体设置团队、智能体或工作流级别的预算、限流和实时成本追踪。
  4. 需要专家审批的业务团队,可在图中使用 intervention nodes 暂停任务并配置超时和升级处理。
  5. 希望试用本地 Ollama 模型的开发者,可按 ollama/model-name 格式经 LiteLLM 配置模型。

这个 Agent 有哪些优点和局限?

优点
  • 以自然语言目标驱动生成 agent graph、连接代码和测试用例,减少手工设计工作流和智能体交互的工作量。
  • 运行层明确覆盖会话隔离、检查点式崩溃恢复、状态持久化、实时可观测性与审计需求,针对长期生产工作负载。
  • 支持并行多智能体执行、共享缓冲区和失败后的图演化,适合复杂或重复性流程。
  • 经 LiteLLM 兼容提供商支持 OpenAI、Anthropic、Gemini、OpenRouter、Hive LLM 及本地模型,并可通过 MCP 接入业务系统。
  • 内置人工介入节点,支持暂停、超时和升级策略。
局限
  • 安装依赖 Python 3.11+、uv、Shell 或 PowerShell 脚本,以及可用的 LLM 提供商;不是可通过 pip install -e . 完成的常规安装。
  • 运行外部模型和业务系统连接需要配置相应的 API 密钥、网络访问和凭据管理。
  • README 将 JavaScript/TypeScript SDK 标注为路线图,因此当前文档明确的框架语言是 Python。
  • 其生成、演化和控制平面工作流更适合长期业务流程;README 明确表示简单链式试验或一次性脚本未必是最佳匹配。
  • Windows 虽受支持,但 README 对 search_files 建议安装 ripgrep,未安装时会回退到 Python 搜索。

如何安装或部署这个 Agent?

前提是 Python 3.11+、一个为智能体提供能力的 LLM provider,以及 uv。克隆并在仓库根目录运行:

git clone https://github.com/aden-hive/hive.git
cd hive
./quickstart.sh

Windows PowerShell 5.1+ 使用 ./quickstart.ps1。不要在仓库根目录执行 pip install -e .;README 明确说明这会创建占位包,Hive 将无法正常工作。脚本会交互式配置默认模型(包括 Hive LLM 和 OpenRouter)、创建 ~/.hive/credentials 加密凭据存储,并安装所需依赖。

如何使用这个 Agent?

完成 quickstart 后,浏览器会打开 Hive 界面。在主页输入框描述要构建的智能体,按 Queen 的问题补充需求;也可选择 “Try a sample agent” 中的模板直接运行或作为基础修改。选择现有或示例智能体后,可点击左上角 Run,或让 Queen 代为运行。以后在项目目录执行 hive open 可重新打开仪表盘。配置模型时需提供相应提供商的 API 密钥环境变量并指定模型名;本地 Ollama 需先在本机运行。

这个 Agent 与同类方案有什么区别?

README 将 Hive 与 Openclaw、Cowork 这类可完成个人任务的单智能体工具作对比:Hive 的定位是业务流程所需的多智能体运行层,强调状态、恢复、并行执行、成本和审计控制。

常见问题

Hive 是否锁定某一家模型提供商?
不是。README 说明它可通过 LiteLLM 兼容提供商使用 OpenAI、Anthropic、Google Gemini、OpenRouter、Hive LLM、DeepSeek、Mistral、Groq 等,也支持本地 Ollama。
发生崩溃或执行失败时会怎样?
项目说明提供检查点式崩溃恢复和失败捕获;其适应性流程会在失败后演化图并自动重新部署。
如何限制模型调用成本?
README 说明可在团队、智能体或工作流层级设置支出上限、限流和自动模型降级策略,并提供实时成本追踪和告警。
能否要求人工批准关键步骤?
可以。intervention nodes 可暂停执行以等待人工输入,并支持可配置的超时和升级策略。
是否适合一次性的简单脚本?
README 表示它可能不是仅做简单智能体链或一次性脚本实验的最佳选择;它主要针对需要生产级状态、恢复和监管的长期流程。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents