自动化与运维 opentelemetry-tracingagent-evaluationguardrailsprompt-optimizationdocker-composeopenai-compatible-gateway

Future AGI

统一追踪、评测、仿真和防护,让 AI 应用可观测、可改进。

FollowAgents 评估 · FARS-2.1
不推荐
51/ 100 五分制 2.6 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全13 / 29 · 2.2/5

证据显示:README 明确说明自托管版本收集遥测数据(注册时收集管理员邮箱和域名,心跳收集匿名使用计数),并提供了禁用选项(FUTURE_AGI_TELEMETRY_DISABLED=1),但禁用后仍会发送一次最小普查 ping,这体现了数据流透明度(2分)。敏感数据处理方面,README 声称不收集 trace 数据、提示词或 API 密钥,但未提供代码级证据,因此扣分(2分)。依赖安全方面,存在 CI 工作流使用第三方 action(如 actions/checkout@v4),但未提供依赖漏洞扫描或 SBOM 证据,因此扣分(1分)。外部影响方面,遥测数据外发是外部影响,但提供了 opt-out 选项,因此给1分。回滚方面,README 提到生产部署使用 ./deploy/setup.sh 生成 secrets 并固定镜像版本,但未提供回滚机制文档,因此扣分(1分)。来源归属方面,README 列出了多个子仓库和 SDK,但未提供明确的来源验证机制,因此给2分。最小权限方面,未发现权限模型文档,但遥测 opt-out 表明有一定控制,因此给1分。用户确认方面,遥测 opt-out 需要用户主动设置,但未提供首次运行的明确确认提示,因此给1分。

2可靠稳定8 / 14 · 2.9/5

自洽性方面,README 中关于功能、架构和性能的声明与仓库结构基本一致,但存在一些不一致,如 README 声称支持 50+ 框架,但未提供完整列表,因此给2分。依赖可用性方面,README 提供了 Docker Compose 和 pip/npm 安装方式,但未提供依赖的可用性保证,因此给2分。失败消息方面,未找到明确的错误处理文档或用户友好的失败消息示例,因此给1分。

3适用触发10 / 18 · 2.8/5

受众和场景方面,README 列出了多种使用场景(客户支持、语音代理、内部工具等),并提供了针对不同场景的说明,因此给2分。能力边界方面,README 明确列出了核心功能(模拟、评估、保护、监控、优化),但未详细说明每个功能的限制,因此给2分。触发精度方面,未找到关于触发条件或精确控制功能的文档,因此给1分。环境适配方面,README 提供了多种部署选项(Docker Compose、生产 overlay、Kubernetes 即将支持),并说明了运行时要求,因此给2分。

4规范维护10 / 18 · 2.8/5

信息架构方面,README 结构清晰,包含快速开始、功能、部署、架构、SDK、比较、路线图等章节,因此给2分。安装说明方面,README 提供了详细的安装步骤(Docker Compose、pip/npm),并说明了前置条件,因此给2分。命名稳定性方面,未找到关于命名约定或 API 稳定性的说明,因此给1分。示例和 FAQ 方面,README 提供了代码示例(Python/TypeScript),但未提供 FAQ 部分,因此给2分。已知限制方面,README 提到“夜间版本,可能有粗糙边缘”,但未详细列出已知限制,因此给1分。许可证方面,LICENSE 文件为 Apache 2.0,且 README 明确说明,因此给3分。版本和变更日志方面,README 提到有 Changelog 链接,但未提供具体内容,因此给1分。维护责任方面,README 提供了社区支持渠道(Discord、GitHub Discussions)和安全报告流程,因此给2分。

5有效结果7 / 13 · 2.7/5

输出可用性方面,README 提供了清晰的输出示例(代码片段、架构图),但未提供实际输出格式的详细说明,因此给2分。边际价值方面,README 声称提供一体化平台,替代多个工具,但未提供与其他工具的详细对比数据,因此给2分。成本效益方面,README 提到免费云层和自托管,但未提供详细的成本分析,因此给1分。

6证据核验3 / 8 · 1.9/5

声明可追溯性方面,README 中的性能声明(如 29k req/s)未提供可复现的基准测试细节,因此给1分。跨来源佐证方面,未提供第三方验证或独立测试结果,因此给1分。事实与推断分离方面,README 将事实(功能列表)和推断(“自改进”)混合,未明确区分,因此给1分。

证据充分度: 评估于 2026年8月9日 审查版本 275dc79be916
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 遥测数据收集:自托管版本默认收集遥测数据,包括管理员邮箱和域名,即使禁用后仍会发送一次普查 ping。请评估隐私影响。
  • 依赖安全:未提供依赖漏洞扫描或 SBOM,建议在部署前进行安全审计。
  • 性能声明:README 中的性能数据(如 29k req/s)未提供可复现的基准测试细节,请谨慎对待。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Future AGI 是一个可自托管的平台,用于评估、观测并改进 LLM 与 AI Agent 应用。其平台层包含 tracer、agentic_eval、simulate 和 model_hub 等组件,另有 Agent Command Center 作为 OpenAI 兼容网关。应用通过 traceAI 的 OpenTelemetry 插桩发送追踪数据,平台可展示 span 图、延迟、令牌成本和仪表盘,并将生产追踪用于后续评测和优化。README 将其运行时列为 Django/Channels、Go 网关、React/Vite 前端,以及 PostgreSQL、ClickHouse、Redis、RabbitMQ 和 Temporal。它可通过 Docker Compose 部署,也提供托管 Cloud 入口;仓库明确标注当前为供早期测试的 nightly 版本。

开发者可在 Python 中调用 register(project_name="my-agent") 并执行 OpenAIInstrumentor().instrument(),或在 TypeScript 中调用 register({ projectName: "my-agent" })new OpenAIInstrumentation().instrument(),为既有 OpenAI 调用添加追踪。traceAI 以 OpenTelemetry 方式采集数据,tracer 接收 OTLP 数据并形成 span 图;平台将元数据存入 PostgreSQL,将 spans 与时序数据存入 ClickHouse。agentic_eval 提供以 evaluate() 调用的 50+ 指标,覆盖 groundedness、hallucination、工具调用正确性、PII、语气和自定义 rubric;simulate 运行多轮 persona、对抗输入和边界场景模拟。Agent Command Center 提供 OpenAI 兼容 HTTP 网关、路由、语义缓存、虚拟密钥、MCP 与 A2A,并可内联或通过 SDK 使用内置扫描器和供应商适配器。优化部分列出 GEPA、PromptWizard、ProTeGi、Bayesian、Meta-Prompt 与 Random 六种提示词优化算法。

  1. 负责生产客服 Agent 的团队,可用 OpenTelemetry 追踪检查 span、延迟、令牌成本,并对真实调用运行评测。
  2. 构建 RAG 搜索或问答系统的开发者,可评估 groundedness、hallucination 和引用相关的输出质量。
  3. 上线前需要压测对话行为的语音 Agent 团队,可针对 LiveKit、VAPI、Retell 或 Pipecat 场景运行多轮仿真。
  4. 需要通过统一入口调用多个模型提供商的平台团队,可将 Agent Command Center 作为 OpenAI 兼容网关并使用路由和语义缓存。
  5. 处理敏感输入或提示注入风险的应用团队,可在网关内联或 SDK 中使用 PII、jailbreak、injection 等扫描器。
  6. 持续迭代提示词的团队,可把生产追踪作为训练数据,使用仓库列出的六类优化算法进行实验。

这个 Agent 有哪些优点和局限?

优点
  • 将 OTLP 追踪、评测、仿真、护栏、提示词优化和 OpenAI 兼容网关放在同一平台,覆盖从测试到生产反馈的闭环。
  • 评测能力明确列出 50+ 指标,并组合 LLM-as-judge、启发式方法和机器学习方法。
  • 自托管路径使用已发布镜像和 Docker Compose;生产脚本可生成密钥并固定镜像标签。
  • 网关列出 100+ 模型提供商、15 种路由策略、语义缓存、虚拟密钥、MCP 和 A2A。
  • 追踪使用 OpenTelemetry,README 列出对 50+ AI 框架的插桩支持。
局限
  • README 明确称其为用于早期测试的 nightly release,稳定版本尚未发布,采用方应预期存在粗糙边缘。
  • 完整自托管栈涉及 Docker Compose,以及 PostgreSQL、ClickHouse、Redis、RabbitMQ 和 Temporal 等多项基础设施。
  • 示例只展示插桩和 OpenAI 客户端调用,未提供客户端初始化、凭据配置或自托管初始用户配置的具体步骤。
  • 自托管实例默认会收集部署遥测;即使设置 FUTURE_AGI_TELEMETRY_DISABLED=1,首次启动后仍会发送一次最小 census ping,若需要完全静默须在网络边界阻断。
  • 官方 Kubernetes/Helm 清单仍标为即将推出,当前云环境部署主要是自行在 VM 上运行 Docker Compose。

如何安装或部署这个 Agent?

自托管前需安装 Docker Desktop 或 Docker Engine,并具备 Docker Compose。然后执行:

git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install

Windows PowerShell 使用:./bin\install.ps1。完成后打开 http://localhost:3000。生产部署可执行 ./deploy/setup.sh,README 说明该脚本会生成必需密钥、固定镜像版本、拉取镜像并启动服务。运行时清单还列出 Python 3.11+、Go 1.23+ 和 Node 20+。

如何使用这个 Agent?

Python 追踪示例:

from fi_instrumentation import register
from traceai_openai import OpenAIInstrumentor
register(project_name="my-agent")
OpenAIInstrumentor().instrument()

随后执行既有的 client.chat.completions.create(...) 调用。TypeScript 可安装并使用 @traceai/fi-core@traceai/openai,执行 register({ projectName: "my-agent" })new OpenAIInstrumentation().instrument() 后调用 OpenAI 客户端。源材料未说明如何创建 client、如何配置模型提供商凭据,或自托管实例的初始管理员创建流程;这些信息需另行确认。

这个 Agent 与同类方案有什么区别?

README 的比较表将 Future AGI 与 Langfuse、Phoenix、Braintrust 和 Helicone 并列。该表称 Future AGI 覆盖开源与自托管、OpenTelemetry 追踪、评测、Agent 仿真、语音 Agent 评测、内置网关、护栏、提示词优化、提示词管理、数据集与实验以及无代码评测构建;表中也将其核心许可证标为 Apache 2.0。

常见问题

可以完全离线运行吗?
README 说明自托管支持 air-gapped/on-prem,并声明没有 phone-home;但其遥测段落说明默认会发送注册与周期性 heartbeat。设置 FUTURE_AGI_TELEMETRY_DISABLED=1 后仍有一次最小 census ping;若需完全无网络通信,需要在网络边界阻断。
自托管部署需要什么?
快速安装要求 Docker Desktop 或 Docker Engine 与 Docker Compose。运行时与数据层还列出了 Python、Go、Node、PostgreSQL、ClickHouse、Redis、RabbitMQ 和 Temporal。
它是否只适用于 OpenAI?
不是。示例使用 OpenAI 插桩,但 README 同时列出 OpenAI、Anthropic、Google Gemini、AWS Bedrock、Azure OpenAI 等 100+ 提供商,以及自托管的 Ollama、vLLM、LM Studio、TGI 和 Llamafile。
能否在网关之外使用护栏?
可以。README 说明 18 个内置扫描器和 15 个供应商适配器既可内联至网关,也可作为独立 SDK 使用。
托管 Cloud 的费用和合规范围是什么?
README 仅称 Cloud 有免费层,并标注 SOC 2 Type II、HIPAA 与区域数据驻留;未给出定价、免费层配额或具体区域列表。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents