开发与工程 realtime-voicesttttswebrtcvoice-agents

LiveKit Agents:实时语音 AI 智能体框架

构建可实时对话、能看能听的语音智能体,支持多模态交互和灵活集成。

FollowAgents 评估 · FARS-2.1
不推荐
43/ 100 五分制 2.2 / 5
1 2 3 4 5 6
1信任安全7 / 29 · 1.2/5

证据显示框架需要环境变量(LIVEKIT_URL等)和API密钥,但未提供最小权限原则的明确说明;用户确认机制未提及;数据流透明度部分体现在文档中提及RPC和数据API,但未详细说明数据流向;敏感数据处理未明确;依赖安全方面有依赖锁定(uv.lock)和CI构建,但未提及漏洞扫描;外部影响方面,框架会连接外部服务(STT/LLM/TTS),但未说明副作用;回滚机制未提及;来源归属方面,代码和文档明确标注了LiveKit,但发布者未验证。扣分原因:缺乏安全最佳实践文档和用户确认机制。

2可靠稳定6 / 14 · 2.1/5

自一致性较好,README和示例代码一致,但未发现版本兼容性说明;依赖可用性方面,依赖众多且部分需要外部API密钥,但未提供离线或降级方案;失败消息方面,文档未详细说明错误处理。扣分原因:依赖外部服务可能导致不可用,且错误处理文档不足。

3适用触发10 / 18 · 2.8/5

受众明确为开发者,场景覆盖语音、视频、文本等;能力边界在README中通过功能列表和示例说明,但未明确限制;触发精度方面,工具调用和事件处理有示例,但未详细说明触发条件;环境适配方面,支持多种平台和部署方式,但未说明资源需求。扣分原因:触发精度和资源需求说明不足。

4规范维护10 / 18 · 2.8/5

信息架构清晰,有README、文档链接、示例目录;安装说明详细,提供pip安装命令;命名稳定性方面,API名称在示例中一致,但未提供命名规范文档;示例和FAQ丰富,但FAQ未单独列出;已知限制未明确;许可证为Apache-2.0,清晰;版本变更日志未提供;维护责任方面,有贡献指南和社区渠道,但未明确维护者。扣分原因:缺少版本变更日志和已知限制说明。

5有效结果7 / 13 · 2.7/5

输出可用性方面,提供了多种示例和测试框架,但未提供输出格式规范;边际价值方面,框架功能丰富,但未与同类产品对比;成本效益方面,未提供性能或成本数据。扣分原因:缺乏成本效益分析。

6证据核验3 / 8 · 1.9/5

声明可追溯性方面,README中的功能声明有示例支持,但未提供详细文档链接;跨来源佐证方面,有多个示例和测试,但未提供独立验证;事实与推断分离方面,文档中未明确区分事实和推断。扣分原因:缺乏独立验证和事实推断分离。

证据充分度: 评估于 2026年8月9日 审查版本 02569a407946
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:执行前用户确认、回滚或恢复路径
使用前请注意
  • 发布者身份未验证,需谨慎对待供应链风险。
  • 框架依赖大量外部服务和API密钥,需确保密钥安全。
  • 未提供版本变更日志,升级时需自行检查兼容性。
  • 未明确已知限制,生产使用前需自行评估。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

LiveKit Agents 是一个面向服务器端实时语音智能体的 Python 框架。它提供 AgentSession 管理对话,Agent 定义指令与工具,AgentServer 负责任务调度,并通过 WebRTC 与客户端交互。框架支持多种 STT、LLM、TTS 模型,可通过插件或 LiveKit Inference 统一 API 接入,并提供 RPC、数据 API、MCP 支持和内置测试框架。

该框架提供一个 AgentServer 进程,监听房间会话并启动 AgentSession。开发者在 @server.rtc_session 入口函数中创建会话,配置 VAD、STT、LLM、TTS(例如 deepgram/nova-3、google/gemma-4-31b-it、cartesia/sonic-3),然后通过 Agent 的 instructions 和工具(@function_tool)定义行为。会话支持生成回复、多智能体交接、结构化输出,并可通过 CLI(console、dev、start)运行。

  1. 开发人员快速构建 WebRTC 语音助手,用于客户服务或虚拟助手。
  2. 需要实时语音交互的场景,如电话机器人(通过 SIP 集成)。
  3. 多智能体协同任务,如收集信息后交给后续智能体处理。
  4. 需要结构化输出(如 JSON)来引导 TTS 语气的场景。
  5. 需要 MCP 工具集成,实现与外部系统的交互。
  6. 测试语音智能体行为,使用内置测试框架和 judge 进行自动验证。

这个 Agent 有哪些优点和局限?

优点
  • 持续更新,提供多种模型集成(OpenAI、Deepgram、Cartesia 等)。
  • 内置任务调度和分发 API,易于扩展多智能体。
  • 支持 WebRTC 客户端 SDK,覆盖主流平台。
  • 内置测试框架,帮助确保智能体行为正确。
  • MCP 原生支持,一行代码集成 MCP 服务器工具。
局限
  • 需要 LiveKit 服务器(云或自托管),增加部署复杂性。
  • 必须配置 API 密钥和网络连接。
  • 部分功能依赖特定模型提供商,可能产生费用。
  • 框架处于快速开发阶段,API 可能变化。

如何安装或部署这个 Agent?

使用 pip 安装核心库及插件:pip install "livekit-agents[openai,deepgram,cartesia]"。需要 Python 环境。

如何使用这个 Agent?

设置环境变量 LIVEKIT_URL、LIVEKIT_API_KEY、LIVEKIT_API_SECRET。运行 python myagent.py dev 启动开发服务器并支持热重载。生产环境使用 python myagent.py start。也可用 python myagent.py console 在终端测试。

这个 Agent 与同类方案有什么区别?

此框架区别于纯聊天的库,它专注于实时语音交互,并且与 LiveKit 生态深度集成,需要搭配 LiveKit 服务器使用。

常见问题

如何开始?
安装库,设置 LiveKit 环境变量,运行一个示例脚本即可。
支持哪些语音模型?
支持 Deepgram、OpenAI、Cartesia 等,可通过插件或 LiveKit Inference 统一 API 接入。
可以用于电话呼叫吗?
可以,通过 LiveKit 的 SIP 集成。
框架的开源情况?
完全开源(Apache-2.0),可自托管。
如何测试智能体?
使用内置测试框架,编写测试并利用 LLM judge 进行验证。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents