Aurora

开源 AI 智能体驱动的故障管理与根因分析工具,收到告警后自动调查全栈,几分钟内交付结构化 RCA,让值班工程师告别凌晨三点手工排查。

Star 数
★ 426
最近更新
今天
License
Apache-2.0
主语言
Python

30 秒速览

运行形态
自托管服务网页应用MCP 服务器
可在哪里用
通用 · 跨平台OpenAI API · Claude API
费用
软件免费,模型调用费用自付
上手难度
高 · 需要较重的基础设施
开始前需要
DockerKubernetes(用于沙箱执行与 Helm 部署)HashiCorp VaultPostgreSQLRedisMemgraphLLM API 密钥(OpenRouter、OpenAI 等)Shell / 命令行网络访问本地文件系统MCP Server
典型场景
SRE 团队在凌晨收到 PagerDuty 或 Datadog 告警,希望告警在后台被自动分诊并调查,而不是叫醒值班工程师手工排查 30-60 分钟。
不适合
  • 无法自建服务器或管理 Docker/Kubernetes 基础设施的小团队
  • 不愿意授予 LLM 读取云与集群凭证的组织
  • 需要厂商托管 SaaS 开箱即用的用户

这个 Agent 能做什么,适合哪些场景?

Aurora 是 Arvo-AI 开源的 AI 智能体故障管理平台,面向 SRE 与 DevOps 团队。告警接入后,它基于 LangGraph 的智能体在沙箱化的 Kubernetes Pod 中动态选用 30 多个工具,自动执行 kubectl、aws、az、gcloud 等命令,跨 AWS、Azure、GCP、Kubernetes 等基础设施查询日志、检查部署并关联数据,产出结构化根因分析报告。系统由 Python/Flask 后端与 Celery 工作进程、Next.js 前端、Memgraph 图数据库、Vault 密钥管理和 PostgreSQL/Redis 存储组成,通过 Docker Compose 或 Helm 部署在用户自己的基础设施上,100% 自托管、零遥测。它还支持自动生成事后复盘报告并导出到 Confluence、Notion 或 SharePoint,可通过基础设施知识图谱追踪故障影响面,并能生成包含修复方案的 Pull Request。

Aurora 通过 PagerDuty、Datadog、Grafana、New Relic、OpsGenie、incident.io 以及 CloudWatch 告警 Webhook 接入告警,每条告警自动触发一次后台调查。LangGraph 智能体在隔离的 Kubernetes Pod(带 NetworkPolicy)中动态选择并执行 30 多个工具,运行 kubectl、aws、az、gcloud 命令,查询日志、检查部署并跨服务与云厂商关联数据;调查过程还结合知识库 RAG、基础设施依赖图谱(Memgraph)做爆炸半径分析。调查完成后输出含时间线、根因、影响评估与修复建议的 RCA 报告,可自动生成事后复盘文档并导出到 Confluence/Notion/SharePoint,还能生成修复 Pull Request,触发自动化 Actions(开 PR、通知 Slack)。持久化的 Artifacts 文档随调查进展持续更新;平台同时提供 MCP Server(供 Cursor、Claude Desktop、Windsurf 使用)、Terraform/IaC 分析、SigmaHQ 命令守卫(37 条威胁检测签名)与 NeMo 输入护栏。

  1. SRE 团队在凌晨收到 PagerDuty 或 Datadog 告警,希望告警在后台被自动分诊并调查,而不是叫醒值班工程师手工排查 30-60 分钟。
  2. 多云团队需要一条命令调查横跨 AWS、Azure、GCP、Kubernetes 甚至 Fly.io 的故障,并追踪服务间的爆炸半径。
  3. 工程负责人希望在故障结束后自动生成含时间线与影响评估的事后复盘,直接导出到 Confluence、Notion 或 SharePoint。
  4. 平台团队希望把机构内的调查知识沉淀下来,避免知识只存在于个别工程师脑中。
  5. 安全敏感组织要求故障数据绝不离开自有基础设施,且支持 Ollama 实现完全气隙运行。
  6. MCP 用户希望在 Cursor 或 Claude Desktop 中直接调用 Aurora 的调查能力。

如何安装或部署这个 Agent?

本地评估约 5 分钟即可跑起来(需要 Docker):

bash

git clone https://github.com/arvo-ai/aurora.git && cd aurora

make init # 生成安全密钥
nano .env # 填入 LLM API key(OpenRouter、OpenAI 等)
make prod-prebuilt # 拉取预构建镜像并启动

打开 http://localhost:3000,第一个注册的用户成为管理员。首次启动后还需配置 Vault:

bash
# 获取自动生成的 root token

docker logs vault-init 2>&1 | grep "Root Token:"

# 写入 .env

echo "VAULT_TOKEN=hvs.your-token-here" >> .env

# 重启以连接 Vault

make down && make prod-prebuilt

其他安装方式:固定版本 make prod-prebuilt VERSION=v1.2.3;从源码构建 make prod-local;生产 Kubernetes 用 Helm:

bash

helm repo add aurora https://raw.githubusercontent.com/Arvo-AI/aurora/gh-pages
helm repo update
helm show values aurora/aurora-oss > my-values.yaml

# 编辑 my-values.yaml,然后:

helm install aurora-oss aurora/aurora-oss -n aurora --create-namespace -f my-values.yaml

也可通过 OCI 安装:oci://ghcr.io/arvo-ai/charts/aurora-oss。气隙/受限网络环境另有 air-tight bundle 部署方案。

如何使用这个 Agent?

部署后打开 http://localhost:3000,第一位注册用户即管理员。唯一必需的外部配置是 .env 中的 LLM API key(OpenRouter、OpenAI、Anthropic、Gemini、Vertex AI、AWS Bedrock 或自托管 Ollama);云厂商连接器均为可选,无任何云账号也能运行。日常流程:把 PagerDuty、Datadog、Grafana、New Relic、OpsGenie、incident.io 或 CloudWatch 告警 Webhook 接入 Aurora;告警到达后自动触发后台调查,智能体在沙箱 Pod 中执行 kubectl/aws/az/gcloud 并生成 RCA。管理员可在知识图谱中查看基础设施依赖,将调查文档导出为事后复盘,或配置 Actions 在调查完成后自动开修复 PR、通知 Slack。

这个 Agent 有哪些优点和局限?

优点
  • 告警自动触发全栈调查:智能体在带 NetworkPolicy 的沙箱 Kubernetes Pod 中执行 kubectl/aws/az/gcloud,不占用控制面,配合 SigmaHQ 37 条威胁签名与 NeMo 提示注入护栏。
  • 覆盖端到端闭环:RCA 报告、自动事后复盘(导出 Confluence/Notion/SharePoint)、修复 PR 生成与 Actions 工作流。
  • 模型与云厂商无关:OpenAI、Anthropic、Gemini、Vertex AI、AWS Bedrock、OpenRouter、Ollama(气隙)均可,跨 AWS/Azure/GCP/OVH/Scaleway/Cloudflare 连接器。
  • 100% 自托管、零遥测,密钥以 Vault 或 AWS Secrets Manager 加密存储,Apache 2.0 无按席位/按事故收费。
局限
  • 部署门槛高:需要 Docker Compose 或 Kubernetes/Helm,外加 Vault、PostgreSQL、Redis、Memgraph 多个服务,首次启动后还要手工配置 Vault root token。
  • 持续成本在 LLM 调用:智能体每条告警都会并行调用大量工具与模型,需要自备付费 API key,源文档未给出用量估算。
  • 安全敏感性高:智能体需要可执行云 CLI 与 kubectl 的凭证,将 LLM 引入云凭证访问路径本身是新的攻击面,需评估护栏是否足够。
  • 作为较新项目,除 README/文档/Discord 外缺乏公开的生产案例或第三方审计证据。

这个 Agent 与同类方案有什么区别?

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 形态 / 费用 Star 最近更新 主语言 完整支持的平台
Aurora 当前 47 · 缺口较多 自托管服务免费 + 模型费 ★ 426 今天 Python OpenAI API · Claude API
HolmesGPT SRE Agent 57 · 缺口较多 命令行工具免费 + 模型费 ★ 3.5k 4 天前 Python OpenAI API
Ongrid 53 · 缺口较多 自托管服务免费 + 模型费 ★ 1.1k 4 天前 Go OpenAI API · Claude API
Archestra 71 · 存在缺口 自托管服务免费版 + 付费版 ★ 4.3k 今天 TypeScript Codex · Claude Code · OpenAI API · Claude API

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
47/ 100 五分制 2.4 / 5
信任安全 8/29
可靠稳定 5/14
适用触发 12/18
规范维护 12/18
有效结果 7/13
证据核验 3/8
查看各维度的扣分理由
信任安全8 / 29 · 1.4/5

README 声称沙箱化 Kubernetes Pod 执行、NetworkPolicy、SigmaHQ 37 条检测签名、NeMo 输入护栏和 Casbin RBAC,但这些均为断言,提供的源文件中没有任何可核查的实现代码;扣分点:核心安全声明全部无代码佐证。扣分项:Vault 根令牌通过 docker logs 打印并复制到 .env 的流程是明文敏感信息暴露面;'Actions' 自动触发开 PR、通知 Slack 等外部效果未见用户确认门槛;无任何回滚机制证据。许可证版权年份写作 2026,属实异且发布者身份未经验证。

可靠稳定5 / 14 · 1.8/5

证据显示 build.yml 的 CI 构建验证被'暂时暂停'(on 触发被注释掉),与 README 强调的成熟度不一致;唯一的 e2e 测试断言 URL 匹配 /(\/chat|\/)/,即无论任何结果都通过,实际不构成验证。扣分点:测试质量与声明严重不符。依赖可用性方面有版本钉扎(VERSION=v1.2.3)和预构建镜像,但依赖清单未提供。

适用触发12 / 18 · 3.3/5

受众与场景描述清晰(SRE 值班告警调查),部署方式覆盖本地 Docker、Helm、气隙环境(Ollama),这是本次评审中最强的一项。扣分点:能力边界完全未文档化('30+ 工具''任意 LLM' 等宣传性表述无边界说明),触发精度仅有 webhook 摄入的泛泛描述。

规范维护12 / 18 · 3.3/5

安装说明详尽(Quick Start、Vault 设置、版本钉扎、Helm/OCI、气隙部署表),可得满分。仓库结构、文档站点、CHANGELOG 引用、SECURITY.md 的 72 小时响应承诺均存在。扣分点:无已知限制章节(仅隐含 Vault 手动步骤);examples/FAQ 缺失;CHANGELOG 内容与版本历史未在证据中可见;CI 构建暂停削弱维护活跃度的证明。

有效结果7 / 13 · 2.7/5

README 描述了结构化 RCA、postmortem 导出、知识图谱等可用输出,且差异化价值(替代 30-60 分钟人工调查)表述清楚;但全部为叙述性声明,无可核查产物,且 LLM 调用成本、令牌消耗、Agent 运行成本完全未讨论,成本收益评估缺位。

证据核验3 / 8 · 1.9/5

关键量化声明('30+ tools'、'37 threat detection signatures'、沙箱隔离、'Zero data sent')在提供的文件中均无法追溯;证据内代码(一条 API 代理路由、一个空转 e2e 测试)与 README 的宏大范围几乎无交叉印证;事实与营销推断混排('Aurora does all of that autonomously'),未做事实/推断分离。扣分点:声明-证据链条整体断裂。

风险与缓解建议
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 所有安全声明(沙箱、护栏、RBAC)均为 README 断言,未在提供文件中见到实现,部署前必须自行审计 server/ 与 deploy/ 中的实际隔离与权限代码。
  • Vault 根令牌通过 docker logs 输出并写入 .env 的流程存在明文泄露风险,生产部署应改用受控的秘密注入方式。
  • 自动开 PR、通知 Slack 等 'Actions' 的外部副作用未见确认门槛,接入真实云账号前应评估误操作风险。
  • CI 构建验证当前处于暂停状态,且唯一 e2e 测试为恒真断言,代码质量信号弱。
  • Agent 需要跨 AWS/Azure/GCP/K8s 的凭据,权限范围远超最小必要,建议为连接器配置只读角色并逐项审查。
  • 许可文件版权年份写作 2026,发布者身份未经注册表验证,需自行核实组织真实性。
证据充分度:低 评估于 2026年9月28日 审查版本 14177281f457
查看完整评分方法 →

常见问题

必须接入云厂商账号才能用吗?
不需要。README 明确说明唯一的外部依赖是 LLM API key,所有云/K8s 连接器都是可选的;不接连接器也能部署运行(但调查能力会受限)。
智能体执行的命令安全吗?
命令在隔离的 Kubernetes Pod 中执行(带 NetworkPolicy),不运行在控制面上;另有 SigmaHQ 的 37 条威胁检测签名和 NeMo 输入护栏做提示注入检测,并支持组织级命令策略。
数据会发送给 Arvo AI 吗?
不会。Aurora 是 100% 自托管,零遥测,LLM 调用直接从你的基础设施发往你选择的模型提供商;用 Ollama 可实现完全气隙运行。
支持哪些 LLM,费用如何?
支持 OpenAI、Anthropic、Gemini、Vertex AI、AWS Bedrock、OpenRouter 与 Ollama。软件本身 Apache 2.0 免费,但你需要为所选模型提供商的 API 调用付费。
生产环境如何部署?
官方提供 Helm chart(支持 GKE/EKS/AKS,也可从 OCI registry 拉取)以及面向气隙/受限网络的 air-tight bundle;本地评估用 make prod-prebuilt 即可。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents