开发与工程 typescript-sdkcognitive-memorymulti-agent-orchestrationruntime-tool-forgingragguardrailsvoice-telephonyvector-search

AgentOS

让 TypeScript 智能体在长会话中保留记忆、编排协作并按需生成工具。

FollowAgents 评估 · FARS-2.1
不推荐
52/ 100 五分制 2.6 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全10 / 29 · 1.7/5

证据显示:README 描述了运行时工具锻造在 node:vm 沙箱中运行,有 5 秒墙钟限制,禁止 eval/require/process,并提到 guardrails 和 HITL 门控,但未提供具体实现细节或权限模型。用户确认机制仅在 HITL 门控中提及,未详细说明。数据流透明度方面,README 提到可观测性(OpenTelemetry、使用账本),但未展示具体数据流图。敏感数据处理方面,提到 PII 防护包,但未深入。依赖安全方面,CI 使用 pnpm 安装,但未提供依赖审计或漏洞扫描证据。外部影响方面,提到渠道适配器(Telegram、Discord 等),但未说明权限控制。回滚方面,提到 checkpointing,但未说明回滚机制。来源归属方面,README 提到 Apache-2.0 和贡献指南,但未明确第三方代码归属。扣分原因:多数安全特性仅声明,缺乏实现细节或测试证据。

2可靠稳定6 / 14 · 2.1/5

证据显示:README 和测试文件展示了内存集成测试,测试覆盖了 processRequest 和 handleToolResult 流程,表明内部一致性较好。依赖可用性方面,package.json 列出了大量导出路径,但未提供依赖列表或版本锁定信息。失败消息方面,测试中有超时错误消息,但未提供用户可见的错误处理文档。扣分原因:依赖可用性和失败消息缺乏具体证据。

3适用触发12 / 18 · 3.3/5

证据显示:README 明确面向开发者,提供了多种使用场景(agent、agency、workflow 等),并说明了能力边界(如工具锻造的沙箱限制)。触发精度方面,提供了 API 参考和示例,但未详细说明触发条件。环境适配方面,支持 11 个 LLM 提供商和多种存储后端,但未提供环境变量配置的完整列表。扣分原因:部分细节在文档中,但静态审查无法验证。

4规范维护11 / 18 · 3.1/5

证据显示:README 提供了清晰的信息架构,包括安装、快速入门、API 参考、文档链接。安装说明简单明了。命名稳定性方面,包名和 API 名称在 README 中一致。示例和 FAQ 方面,提供了多个代码示例,但未提供 FAQ。已知限制方面,README 未明确列出已知限制。许可证为 Apache-2.0,版本号在 package.json 中为 0.10.14,但未提供 CHANGELOG 文件。维护责任方面,README 提供了贡献指南和维护者文件。扣分原因:缺少已知限制和 CHANGELOG。

5有效结果9 / 13 · 3.5/5

证据显示:README 提供了丰富的功能描述和基准测试结果,表明输出可用性较高。边际价值方面,提供了与其他框架的比较,突出了差异化功能。成本效益方面,提到了基准测试的成本($0.0090/correct),但未提供总体成本分析。扣分原因:成本效益分析不完整。

6证据核验4 / 8 · 2.5/5

证据显示:README 提供了基准测试的详细方法(如 bootstrap 95% CI、judge-FPR 探针),并链接到外部基准仓库,表明声明可追溯。跨来源佐证方面,基准测试结果来自外部仓库,但静态审查无法验证。事实与推断分离方面,README 区分了功能描述和基准测试结果,但未明确标注哪些是推断。扣分原因:跨来源佐证和事实推断分离缺乏直接证据。

证据充分度: 评估于 2026年8月9日 审查版本 acd5c9bf5027
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 静态审查无法验证运行时行为,如沙箱安全性、权限模型、数据流等。
  • README 中的基准测试结果来自外部仓库,未在本次审查中验证。
  • 依赖安全未提供审计或漏洞扫描证据。
  • 缺少已知限制和 CHANGELOG 文件。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

AgentOS 是一个以 npm 包形式交付的 TypeScript 智能体框架,核心接口包括 agent()、agency()、workflow()、AgentGraph 和 mission()。它通过 session() 保存对话记录,并可组合情景记忆、语义记忆和工作记忆;SOUL.md 工作区还可将 Markdown wiki 作为长期记忆的源数据。运行时,智能体可在工具缺口出现时生成带 Zod schema 的 TypeScript 函数,经 LLM judge 审核后在受限的 node:vm 沙箱中执行,并在当前会话中加入工具目录。框架覆盖 11 个 LLM 提供方、RAG、护栏、语音与电话能力,以及六种多智能体协作策略。它面向嵌入 Node.js 应用的开发者库,而非文档中描述的独立托管聊天产品。

开发者用 agent({...}) 创建智能体,再通过 agent.session('id') 取得会话并调用 session.send('...') 发送任务。会话保存助手工具调用、工具结果和 thinking blocks,并默认在约 120K token 估算上限后按完整区块淘汰历史;session.reseed(snapshot) 可原子替换历史,session.messages() 可导出检查点材料。agent() 可调用配置的 LLM 提供方、使用记忆和工具;agency() 按 sequential、parallel、debate、review-loop、hierarchical 或 graph 策略调度多个角色。启用 emergent tooling 时,系统生成 TypeScript 工具函数和 Zod schema,交由独立 LLM judge 审批,再在禁用 eval、require 和 process、墙钟限制为 5 秒的 node:vm 中运行。

  1. 为在线编程辅导产品构建长期跟进的导师:用 session('student-1') 保存多轮上下文,并启用 episodic、semantic 与 working memory。
  2. 为需要研究、撰写和事实复核顺序协作的工程团队搭建 agency(),用 graph 策略和 dependsOn 串联 researcher、writer、reviewer。
  3. 为工具集不完整的自动化流程试验运行时工具生成:让智能体生成带 Zod 输入 schema 的 TypeScript 工具,并经过 LLM judge 审核后在当前会话复用。
  4. 为需要可读长期记忆的个人或工作区智能体使用 souledAgent(),将 SOUL.md 和 memory/ Markdown wiki 作为记忆源数据。
  5. 为需要模型供应商切换、RAG、护栏或语音电话集成的 TypeScript 应用采用统一运行时接口。

这个 Agent 有哪些优点和局限?

优点
  • agent()、agency()、workflow()、AgentGraph 与 mission() 覆盖单智能体、团队和图式编排,并共享一个运行时。
  • 运行时工具生成具有明确链路:TypeScript 函数、Zod schema、LLM judge 审批和受限 node:vm 执行,而不是直接执行任意生成代码。
  • 会话记录独立于记忆系统,支持 reseed()、messages() 和可配置历史上限,适合需要检查点的长工具调用循环。
  • 支持 11 个 LLM 提供方,并将供应商回退设计为显式 fallbackProviders 配置,不会静默切换模型。
局限
  • 需要配置 API 密钥或本地 CLI 提供方;不同供应商的模型、费用和可用性仍由所选集成决定。
  • 运行时生成工具依赖额外的 LLM judge,并受 node:vm 的 5 秒墙钟及禁用 eval、require、process 等限制。
  • 默认会话历史在约 120K token 估算后会按区块淘汰;需要长期完整上下文的应用必须设置历史上限或使用 reseed() 管理状态。
  • README 提供的 LongMemEval 成绩基于指定的 gpt-4o reader/judge 与基准设置,不能直接代表其他模型或业务任务的表现。

如何安装或部署这个 Agent?

安装:npm install @framers/agentos。配置所选提供方的凭据:可在调用中传入 apiKey,启动时使用 setDefaultProvider(),或设置环境变量;文档明确列出 OPENAI_API_KEY 与 ANTHROPIC_API_KEY,并说明会按优先级自动检测。该包的运行时工具沙箱使用 node:vm,因此运行环境需要 Node.js;README 未给出最低 Node.js 版本。

如何使用这个 Agent?

最小调用:import { agent } from '@framers/agentos'; const tutor = agent({ provider: 'anthropic', instructions: 'You are a patient CS tutor.', personality: { openness: 0.9, conscientiousness: 0.95 }, memory: { types: ['episodic', 'semantic'], working: { enabled: true } } }); const session = tutor.session('student-1'); await session.send('Explain recursion with an analogy.'); await session.send('Can you expand on that?'); 若省略 provider,框架会从环境变量检测提供方。需要无状态会话时同时设置 memory: false 和 history: false;仅关闭 memory 不会关闭默认的会话历史。

这个 Agent 与同类方案有什么区别?

仓库将 AgentOS 与 LangChain/LangGraph、Vercel AI SDK、CrewAI 和 Mastra 对比,强调其认知记忆、HEXACO 人格、运行时工具生成、六种团队策略、向量后端、护栏与已公布的 LongMemEval 方法学。是否存在实际优势仍取决于目标模型、工作负载和所需集成。

常见问题

它能使用 OpenAI 和 Anthropic 吗?
可以。README 将 OpenAI 和 Anthropic 列为支持的 API-key 提供方;可通过 provider 配置、inline apiKey、setDefaultProvider() 或环境变量选择。
会在提供方失败时自动换模型吗?
不会。跨提供方回退仅在 agent({ fallbackProviders: [...] }) 显式配置时启用。
运行时生成的工具是否直接拥有 Node.js 权限?
README 描述其在 hardened node:vm 中运行,墙钟限制为 5 秒,并禁用 eval、require 和 process;工具先需通过独立 LLM judge 的审批。
成本如何?
仓库报告 LongMemEval-S 的特定 gpt-4o 配置为每个正确答案 0.0090 美元;实际成本取决于所选提供方、模型、调用量和生成工具等功能。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents