Qwen Audio Agent
让语音助理在对话持续进行时并行完成后台任务。
- Star 数
- ★ 2.7k
- 最近更新
- 今天
- License
- Apache-2.0
- 主语言
- JavaScript
- FA 评分
- 59/100 · 缺口较多
30 秒速览
- 可在哪里用
- 通用 · 跨平台Codex · Claude Code(部分支持)
- 开始前需要
- 典型场景
- 希望在语音聊天不断开的同时,把资料查询或工具调用交给后台处理的个人助理用户。
- 主要局限
- 默认实时前台依赖 DashScope API Key;麦克风音频与实时对话会发送至所配置的实时服务。
- 源码审查
- 59/100 · 缺口较多
这个 Agent 能做什么,适合哪些场景?
Qwen Audio Agent 是一个实时语音运行时,通过 Gateway 将持续语音对话与异步后台任务结合起来。它提供终端 TUI、WebUI 和 macOS 桌面悬浮球;桌面版内置 Gateway,也可连接同一用户配置目录中已运行的 Gateway。前台可使用 DashScope 的 Qwen Audio 3.0 Realtime,或连接 Hugging Face speech-to-speech 提供的 OpenAI Realtime 兼容服务。需要持续处理或调用工具的请求可交给后台 Agent,任务状态与结果会回到当前对话。它还在本地保存用户档案、明确要求记住的信息、任务状态和经凭据脱敏后轮转的日志。
运行 qwenaudio 后,Gateway 连接配置的实时语音前台服务,接收麦克风音频并维持语音对话。可直接回答的内容由前台处理;需要长期执行的工作则可交给由 AGENT_PROTOCOL 或 --backend 选定的后台 Agent。已配置的 OpenCode、OpenClaw、Qoder、Kimi Code、Hermes、CodeBuddy、Codex 或 Claude Code 可作为后台选项,其中通用 ACP stdio 接入使用 ACP_COMMAND、ACP_ARGS、ACP_LABEL 和 ACP_WORKSPACE 配置。用户可通过 qwenaudio setup 查看可用后台 Agent,并查询、追问或取消异步任务;完成结果会返回到当前对话。它把 USER.md、frontend-memory.json、tasks.json 和 logs/ 保存在 ~/.config/qwaudio/。
- 希望在语音聊天不断开的同时,把资料查询或工具调用交给后台处理的个人助理用户。
- 已使用 OpenCode 或 OpenClaw,想通过语音入口复用其用户级模型、工具、MCP、Skill 和认证的开发者。
- 在 macOS 上希望使用常驻菜单栏、可自动隐藏并通过快捷键唤回的语音悬浮球的用户。
- 拥有 NVIDIA GPU 或 Apple Silicon,且希望将 VAD、STT、LLM、TTS 语音链路部署为本地 speech-to-speech 服务的用户。
- 需要把 Gateway 安装为用户后台服务,并以语音持续追踪多个独立任务状态的用户。
如何安装或部署这个 Agent?
需要 Node.js 22.22.2+ 或 24.15.0+ 与 npm 10+。执行:
npm install -g qwen-audio-agent然后执行 qwenaudio config,在生成的 config.env 中填写 DASHSCOPE_API_KEY,并可设置 QWEN_AUDIO_REALTIME_MODEL=qwen-audio-3.0-realtime-plus。默认实时前台需要 DashScope API Key;若改用本地 speech-to-speech,可设置 QWEN_AUDIO_REALTIME_PROVIDER=speech-to-speech 和 SPEECH_TO_SPEECH_REALTIME_URL=ws://127.0.0.1:8765/v1/realtime。
如何使用这个 Agent?
完成配置后,在一个终端运行 qwenaudio 启动 Gateway;在另一终端运行 qwenaudio tui 启动终端界面,或运行 qwenaudio webui 使用浏览器界面。若需后台任务,在 config.env 中设置例如 AGENT_PROTOCOL=openclaw,或使用 AGENT_PROTOCOL=acp、ACP_COMMAND=your-agent、ACP_ARGS=["--acp"] 接入支持 ACP stdio 的 Agent。可运行 qwenaudio setup 查看后台 Agent;要长期常驻则运行 qwenaudio gateway install。
这个 Agent 有哪些优点和局限?
- 全双工实时语音、自然打断和持续多轮对话,与后台任务并行设计明确。
- 同时提供 Gateway、TUI、WebUI 和 macOS 悬浮球,桌面版可自行管理内置 Gateway。
- 支持原生 ACP、内置 ACP 桥接和通用 ACP stdio 配置,可复用已配置后台 Agent 的工具、MCP、Skill 与认证。
- 除默认 DashScope 路径外,还可连接本地或自定义部署的 speech-to-speech OpenAI Realtime 兼容服务。
- 默认实时前台依赖 DashScope API Key;麦克风音频与实时对话会发送至所配置的实时服务。
- Linux 与 Windows 的 TUI 默认半双工,首次使用需要安装 sounddevice 和系统 PortAudio;无回声消除的全双工模式建议佩戴耳机。
- Codex 和 Claude Code 标为外部 ACP 适配,需要安装本体与适配器并由用户完成配置。
- 启用 QWEN_AUDIO_AGENT_BACKEND_PERMISSION_MODE=full 后,后台 Agent 可执行命令和修改文件,仅适合可信项目。
这个 Agent 与同类方案有什么区别?
前台语音可选 DashScope Qwen Audio 3.0 Realtime,或用户自行运行的 Hugging Face speech-to-speech。前者需要 DashScope API Key;后者提供 OpenAI Realtime 兼容接口,并可将 VAD、STT、LLM、TTS 组合在本地或按需替换服务。后台方面,OpenCode、OpenClaw、Qoder、Kimi Code、Hermes、CodeBuddy、Codex 和 Claude Code 的接入完整度与准备要求不同;通用 ACP stdio 入口可用于其他支持该协议的 Agent。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| Qwen Audio Agent 当前 | 59 · 缺口较多 | ★ 2.7k | 今天 | JavaScript | — |
| Lotti 私人日志与任务助手 | 80 · 表现良好 | ★ 1.2k | 4 天前 | Dart | OpenAI API · Claude API |
| BagIdea Office | 71 · 存在缺口 | ★ 230 | 1 天前 | JavaScript | Claude Code · OpenAI API |
| AgentRQ | 64 · 存在缺口 | ★ 1.1k | 今天 | Go | Codex · Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:README 明确说明数据存储位置、API Key 使用、权限模式(full 权限警告)、Gateway 仅限本地使用,并提供了 PRIVACY.md 和 SECURITY.md。但未提供代码级验证,权限模式的具体实现细节未展示,用户确认机制仅在新闻中提到,未提供具体实现。扣分原因:缺少代码级证据,用户确认和权限最小化仅部分体现。
证据显示:有 CI 工作流(多平台、多 Node 版本)和单元测试(message-order.test.js),package.json 中依赖版本固定或使用 ^ 范围,SECURITY.md 提到依赖审计。但未提供运行时可靠性证据,失败消息的具体实现未展示。扣分原因:静态审查无法验证运行时行为,失败消息处理证据不足。
证据显示:README 描述了多种使用场景(前端、后端 Agent、桌面应用),支持多种后端 Agent,提供了配置指南和边界说明。但触发精度(如唤醒词、权限触发)的具体实现未展示,环境适配(如 Windows、Linux)有提及但未验证。扣分原因:触发精度证据不足,环境适配未经验证。
证据显示:README 结构清晰,安装说明详细,版本历史在 News 中列出,LICENSE 为 Apache-2.0,有 CONTRIBUTING.md 和 SECURITY.md。但缺少 CHANGELOG.md 文件(虽然 News 有版本记录),已知限制在 README 中有提及但不够全面。扣分原因:缺少正式 CHANGELOG,已知限制部分不完整。
证据显示:README 描述了核心功能(实时语音、任务并行、多 Agent 支持),提供了使用示例和架构图。但未提供性能数据或用户反馈,成本效益分析缺失。扣分原因:缺乏实际使用效果证据,成本效益未量化。
证据显示:README 中的声明(如功能、架构)有文档和测试支持,CI 和测试文件提供了部分验证。但未提供独立来源的验证,事实与推断的区分不够明确。扣分原因:静态审查无法独立验证,事实与推断分离不充分。
- 静态审查无法验证运行时行为,所有评分基于文档和代码结构。
- 依赖安全:SECURITY.md 提到 electron-builder 的已知漏洞,但未提供完整依赖审计结果。
- 权限模式(full)可能执行命令和修改文件,需谨慎使用。