Qwen Audio Agent

让语音助理在对话持续进行时并行完成后台任务。

Star 数
★ 2.7k
最近更新
今天
License
Apache-2.0
主语言
JavaScript

30 秒速览

可在哪里用
通用 · 跨平台Codex · Claude Code(部分支持)
开始前需要
Node.js 22.22.2+ or 24.15.0+npm 10+DashScope API Key for the default realtime providerShell / 命令行网络访问本地文件系统MCP Server
典型场景
希望在语音聊天不断开的同时,把资料查询或工具调用交给后台处理的个人助理用户。
主要局限
默认实时前台依赖 DashScope API Key;麦克风音频与实时对话会发送至所配置的实时服务。

这个 Agent 能做什么,适合哪些场景?

Qwen Audio Agent 是一个实时语音运行时,通过 Gateway 将持续语音对话与异步后台任务结合起来。它提供终端 TUI、WebUI 和 macOS 桌面悬浮球;桌面版内置 Gateway,也可连接同一用户配置目录中已运行的 Gateway。前台可使用 DashScope 的 Qwen Audio 3.0 Realtime,或连接 Hugging Face speech-to-speech 提供的 OpenAI Realtime 兼容服务。需要持续处理或调用工具的请求可交给后台 Agent,任务状态与结果会回到当前对话。它还在本地保存用户档案、明确要求记住的信息、任务状态和经凭据脱敏后轮转的日志。

运行 qwenaudio 后,Gateway 连接配置的实时语音前台服务,接收麦克风音频并维持语音对话。可直接回答的内容由前台处理;需要长期执行的工作则可交给由 AGENT_PROTOCOL 或 --backend 选定的后台 Agent。已配置的 OpenCode、OpenClaw、Qoder、Kimi Code、Hermes、CodeBuddy、Codex 或 Claude Code 可作为后台选项,其中通用 ACP stdio 接入使用 ACP_COMMAND、ACP_ARGS、ACP_LABEL 和 ACP_WORKSPACE 配置。用户可通过 qwenaudio setup 查看可用后台 Agent,并查询、追问或取消异步任务;完成结果会返回到当前对话。它把 USER.md、frontend-memory.json、tasks.json 和 logs/ 保存在 ~/.config/qwaudio/。

  1. 希望在语音聊天不断开的同时,把资料查询或工具调用交给后台处理的个人助理用户。
  2. 已使用 OpenCode 或 OpenClaw,想通过语音入口复用其用户级模型、工具、MCP、Skill 和认证的开发者。
  3. 在 macOS 上希望使用常驻菜单栏、可自动隐藏并通过快捷键唤回的语音悬浮球的用户。
  4. 拥有 NVIDIA GPU 或 Apple Silicon,且希望将 VAD、STT、LLM、TTS 语音链路部署为本地 speech-to-speech 服务的用户。
  5. 需要把 Gateway 安装为用户后台服务,并以语音持续追踪多个独立任务状态的用户。

如何安装或部署这个 Agent?

需要 Node.js 22.22.2+ 或 24.15.0+ 与 npm 10+。执行:

npm install -g qwen-audio-agent

然后执行 qwenaudio config,在生成的 config.env 中填写 DASHSCOPE_API_KEY,并可设置 QWEN_AUDIO_REALTIME_MODEL=qwen-audio-3.0-realtime-plus。默认实时前台需要 DashScope API Key;若改用本地 speech-to-speech,可设置 QWEN_AUDIO_REALTIME_PROVIDER=speech-to-speech 和 SPEECH_TO_SPEECH_REALTIME_URL=ws://127.0.0.1:8765/v1/realtime。

如何使用这个 Agent?

完成配置后,在一个终端运行 qwenaudio 启动 Gateway;在另一终端运行 qwenaudio tui 启动终端界面,或运行 qwenaudio webui 使用浏览器界面。若需后台任务,在 config.env 中设置例如 AGENT_PROTOCOL=openclaw,或使用 AGENT_PROTOCOL=acp、ACP_COMMAND=your-agent、ACP_ARGS=["--acp"] 接入支持 ACP stdio 的 Agent。可运行 qwenaudio setup 查看后台 Agent;要长期常驻则运行 qwenaudio gateway install。

这个 Agent 有哪些优点和局限?

优点
  • 全双工实时语音、自然打断和持续多轮对话,与后台任务并行设计明确。
  • 同时提供 Gateway、TUI、WebUI 和 macOS 悬浮球,桌面版可自行管理内置 Gateway。
  • 支持原生 ACP、内置 ACP 桥接和通用 ACP stdio 配置,可复用已配置后台 Agent 的工具、MCP、Skill 与认证。
  • 除默认 DashScope 路径外,还可连接本地或自定义部署的 speech-to-speech OpenAI Realtime 兼容服务。
局限
  • 默认实时前台依赖 DashScope API Key;麦克风音频与实时对话会发送至所配置的实时服务。
  • Linux 与 Windows 的 TUI 默认半双工,首次使用需要安装 sounddevice 和系统 PortAudio;无回声消除的全双工模式建议佩戴耳机。
  • Codex 和 Claude Code 标为外部 ACP 适配,需要安装本体与适配器并由用户完成配置。
  • 启用 QWEN_AUDIO_AGENT_BACKEND_PERMISSION_MODE=full 后,后台 Agent 可执行命令和修改文件,仅适合可信项目。

这个 Agent 与同类方案有什么区别?

前台语音可选 DashScope Qwen Audio 3.0 Realtime,或用户自行运行的 Hugging Face speech-to-speech。前者需要 DashScope API Key;后者提供 OpenAI Realtime 兼容接口,并可将 VAD、STT、LLM、TTS 组合在本地或按需替换服务。后台方面,OpenCode、OpenClaw、Qoder、Kimi Code、Hermes、CodeBuddy、Codex 和 Claude Code 的接入完整度与准备要求不同;通用 ACP stdio 入口可用于其他支持该协议的 Agent。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
Qwen Audio Agent 当前 59 · 缺口较多 ★ 2.7k 今天 JavaScript
Lotti 私人日志与任务助手 80 · 表现良好 ★ 1.2k 4 天前 Dart OpenAI API · Claude API
BagIdea Office 71 · 存在缺口 ★ 230 1 天前 JavaScript Claude Code · OpenAI API
AgentRQ 64 · 存在缺口 ★ 1.1k 今天 Go Codex · Claude Code

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
59/ 100 五分制 3.0 / 5
信任安全 14/29
可靠稳定 8/14
适用触发 10/18
规范维护 13/18
有效结果 9/13
证据核验 5/8
查看各维度的扣分理由
信任安全14 / 29 · 2.4/5

证据显示:README 明确说明数据存储位置、API Key 使用、权限模式(full 权限警告)、Gateway 仅限本地使用,并提供了 PRIVACY.md 和 SECURITY.md。但未提供代码级验证,权限模式的具体实现细节未展示,用户确认机制仅在新闻中提到,未提供具体实现。扣分原因:缺少代码级证据,用户确认和权限最小化仅部分体现。

可靠稳定8 / 14 · 2.9/5

证据显示:有 CI 工作流(多平台、多 Node 版本)和单元测试(message-order.test.js),package.json 中依赖版本固定或使用 ^ 范围,SECURITY.md 提到依赖审计。但未提供运行时可靠性证据,失败消息的具体实现未展示。扣分原因:静态审查无法验证运行时行为,失败消息处理证据不足。

适用触发10 / 18 · 2.8/5

证据显示:README 描述了多种使用场景(前端、后端 Agent、桌面应用),支持多种后端 Agent,提供了配置指南和边界说明。但触发精度(如唤醒词、权限触发)的具体实现未展示,环境适配(如 Windows、Linux)有提及但未验证。扣分原因:触发精度证据不足,环境适配未经验证。

规范维护13 / 18 · 3.6/5

证据显示:README 结构清晰,安装说明详细,版本历史在 News 中列出,LICENSE 为 Apache-2.0,有 CONTRIBUTING.md 和 SECURITY.md。但缺少 CHANGELOG.md 文件(虽然 News 有版本记录),已知限制在 README 中有提及但不够全面。扣分原因:缺少正式 CHANGELOG,已知限制部分不完整。

有效结果9 / 13 · 3.5/5

证据显示:README 描述了核心功能(实时语音、任务并行、多 Agent 支持),提供了使用示例和架构图。但未提供性能数据或用户反馈,成本效益分析缺失。扣分原因:缺乏实际使用效果证据,成本效益未量化。

证据核验5 / 8 · 3.1/5

证据显示:README 中的声明(如功能、架构)有文档和测试支持,CI 和测试文件提供了部分验证。但未提供独立来源的验证,事实与推断的区分不够明确。扣分原因:静态审查无法独立验证,事实与推断分离不充分。

风险与缓解建议
  • 静态审查无法验证运行时行为,所有评分基于文档和代码结构。
  • 依赖安全:SECURITY.md 提到 electron-builder 的已知漏洞,但未提供完整依赖审计结果。
  • 权限模式(full)可能执行命令和修改文件,需谨慎使用。
证据充分度: 评估于 2026年8月9日 审查版本 a0a3f121dba5 评估后仓库已有新提交,评分可能未覆盖最新改动
查看完整评分方法 →

常见问题

不配置后台 Agent 还能使用吗?
可以。未设置 AGENT_PROTOCOL 或设置为 none 时,Gateway 以仅前台模式运行,实时语音聊天仍可使用;需要后台执行的请求会明确提示当前没有可用后台 Agent。
音频和个人数据保存在哪里?
麦克风音频与实时对话会发送到配置的 DashScope 或 speech-to-speech 实时服务。USER.md、长期记忆、任务状态和日志保存在本机 ~/.config/qwaudio/,日志会进行凭据脱敏和自动轮转。
可以完全本地运行语音前台吗?
可以连接自行运行的 Hugging Face speech-to-speech。文档给出了 Linux/Windows NVIDIA GPU 与 Apple Silicon 的启动示例;该模式下 Gateway 连接本地 Realtime 接口,无需云端 API Key。
后台任务有哪些权限?
默认使用 native 权限模式,由后台 Agent 在需要时询问。full 模式允许后台执行命令和修改文件,文档建议只在可信项目中开启。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents