开发与工程 whatsapp-apilanggraphspeech-to-texttext-to-speechimage-understandingimage-generationvector-memorycloud-run

Ava WhatsApp 智能体

构建能处理文字、语音和图片的 WhatsApp 多模态智能体。

FollowAgents 评估 · FARS-2.1
不推荐
42/ 100 五分制 2.1 / 5
1 2 3 4 5 6
1信任安全6 / 29 · 1.0/5

README 公开了 WhatsApp、Groq、ElevenLabs、Qdrant、Together AI、Supabase 与 Cloud Run 等主要外部组件,并明确列出贡献者;LICENSE 也将版权归于 The Neural Maze,因此来源归属较清楚。但材料没有展示权限范围、发送消息或生成内容前的用户确认、数据保留与删除、密钥保护、个人消息和媒体的敏感数据措施、外部调用的完整数据路径或回滚机制。依赖声明大多采用开放下界而非锁定版本,也没有审计、漏洞扫描或更新策略证据。未验证的发布者身份仅视为未知,没有据此推断风险。

2可靠稳定5 / 14 · 1.8/5

README 对核心能力、课程大纲和技术栈的描述整体一致,pyproject 中的 LangGraph、Groq、ElevenLabs、Together、Qdrant 等依赖也与这些描述相互对应。扣分在于未提供源代码、锁文件、测试、健康检查、重试或降级证据;多个云服务的可用性依赖外部账户和配额,且没有可见的错误消息或故障处理说明。

3适用触发10 / 18 · 2.8/5

目标受众被明确限定为软件、机器学习和 AI 工程师,且覆盖本地聊天、语音、图像、长期记忆、WhatsApp 与 Cloud Run 部署等具体场景,因此受众与场景证据充分。材料也说明并非真正有感知的机器人,但没有系统界定隐私、安全、模型能力或支持范围。触发行为仅以功能列表概述,没有展示消息类型、路由条件、拒绝条件或冲突处理。Python 3.12 要求和针对 Intel Mac 的 Torch/NumPy 条件依赖体现了一定环境适配,但其他平台和部署前提主要被导向未提供的入门文档。

4规范维护10 / 18 · 2.8/5

README 具备目录、课程概览、受众、学习成果、入门、课程表、成本、技术栈、贡献者和许可证等清晰结构,信息架构较强。安装细节仅链接到未包含的 GETTING STARTED 文档,示例主要是课程与演示链接,缺少内联配置示例和 FAQ。README 使用 Ava,而包名和描述为 ai-companion/Your own AI buddy,命名并非完全稳定。局限性只轻描淡写地否认完整感知能力。MIT 文本完整且元数据一致。虽有 0.1.0 版本,但没有变更日志或发布策略。两位贡献者和 The Neural Maze 版权主体清楚,不过未说明维护渠道、支持承诺或更新责任。

5有效结果7 / 13 · 2.7/5

所述产出包括可在手机上交互的 WhatsApp 代理、语音识别与合成、图像理解与生成、记忆和部署流程,对目标工程受众具有明确可用性与整合价值。它把多个单独服务组合为端到端教学项目,具有中等边际价值。但材料未提供实际输出样例、质量标准、性能指标或对替代方案的比较;免费层和 Cloud Run 低成本的说法缺少配额、用量与持续成本分析,多服务密钥和运维负担也未计入。

6证据核验4 / 8 · 2.5/5

功能主张可以大致映射到课程章节、技术栈以及 pyproject 依赖,README 与项目元数据之间存在一定交叉印证。扣分在于没有提供实现文件、测试、配置样例或静态证据来追踪每项行为;README 还包含 production-ready、realistic、high-quality、super cheap 等评价性或营销性表述,却没有明确区分已证实事实、预期效果和主观判断。

证据充分度: 评估于 2026年8月16日 审查版本 338fd6870df9
源码中未见的安全控制:最小权限约束、执行前用户确认、敏感信息处理、回滚或恢复路径
使用前请注意
  • 在处理真实 WhatsApp 对话、语音或图像前,应核实每个外部服务接收的数据、保留期限、删除方式及训练用途。
  • 不要直接用于自主外发消息;应先增加明确的用户确认、收件人校验、速率限制、审计记录和可撤销机制。
  • 部署前应锁定并审计依赖版本,因为当前多数依赖只有最低版本约束,无法据此证明可重复或安全的解析结果。
  • 应核实缺失的安装文档、实现代码和错误处理;本次静态材料不足以验证 production-ready、免费额度或低成本等主张。
  • 发布者身份未经企业注册表验证,仅应视为未知;应独立核实维护渠道和更新责任。
评估证据 [1][2][3]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Ava 是一个面向软件、机器学习和 AI 工程师的端到端课程项目,目标是在 WhatsApp 中运行具有长期记忆的多模态对话智能体。其工作流由 LangGraph 组织,使用 Groq 提供的 Llama 3.3、Llama 3.2 Vision 和 Whisper 处理对话、图片与语音。Qdrant 保存长期记忆,ElevenLabs 生成语音,Together AI 与 FLUX 模型负责生成图片。用户通过 WhatsApp API 收发消息,也可使用 Chainlit 构建聊天界面。项目能够在本地计算机运行,并提供将容器部署到 Google Cloud Run 的课程内容。它是教学型代码库,而不是附带托管服务或通用智能体安装包的现成产品。

Ava 通过 WhatsApp API 接收和发送消息,并把交互交给 LangGraph 工作流处理。文字对话由 Groq 上的 Llama 3.3 驱动;语音输入通过 Whisper 转写,回复可由 ElevenLabs 合成为语音便笺;图片输入由 Llama 3.2 Vision 处理。工作流可保存图状态和聊天记录作为短期记忆,并使用 Qdrant 建立长期向量记忆。需要展示“日常活动”时,它可以借助 Together AI 上的 FLUX 模型生成图片,并向用户发送活动更新和图片。项目还涵盖用 Chainlit 创建聊天界面,以及把 LangGraph 应用以容器形式部署到 Google Cloud Run。

  1. 希望通过完整项目学习 LangGraph 的软件工程师,可实现包含状态持久化和多条处理路径的对话工作流。
  2. 需要制作 WhatsApp 原型的 AI 工程师,可把文字、语音便笺和图片统一接入一个多模态会话。
  3. 研究长期对话记忆的机器学习工程师,可使用 Qdrant 保存用户数月前分享的信息。
  4. 开发语音智能体的团队,可组合 Whisper 语音转文字和 ElevenLabs 文字转语音管线。
  5. 准备验证云端部署流程的开发者,可将 LangGraph 容器应用部署到 Google Cloud Run。
  6. 学习视觉语言模型与扩散模型的开发者,可结合 Llama 3.2 Vision 分析图片,并用 FLUX 生成活动图片。

这个 Agent 有哪些优点和局限?

优点
  • 覆盖 WhatsApp 消息、语音识别、语音合成、图片理解和图片生成,展示了完整的多模态交互链路。
  • 同时实现图状态与聊天历史的短期记忆,以及基于 Qdrant 的长期向量记忆。
  • 课程从 LangGraph 工作流一直延伸到 WhatsApp API 和 Google Cloud Run 部署,范围超过基础示例。
  • Groq、ElevenLabs、Qdrant Cloud 和 Together AI 的免费额度被说明足以用于入门实验,本地运行也可免费进行。
局限
  • 核心交付渠道依赖 WhatsApp API,不是可直接迁移到任意聊天平台的通用接口。
  • 完整功能横跨 Groq、Qdrant、ElevenLabs 和 Together AI,多项外部凭据、网络服务及各自配额会增加配置和故障排查成本。
  • 提供的材料未包含实际安装命令、环境变量清单、Webhook 设置或首次运行命令,无法仅凭这些内容复现。
  • Google Cloud Run 部署可能产生费用;材料只给出大致的“一两美元”实验成本,没有容量、流量或生产成本数据。
  • 代码库定位为课程项目;材料没有给出测试覆盖率、可用性目标、监控、安全控制或生产负载证据。

如何安装或部署这个 Agent?

源码说明安装前需要创建虚拟环境、安装依赖并创建 .env 文件,但所提供材料没有列出可复制的命令、受支持的语言版本、依赖文件名称或具体环境变量键。完整安装步骤被放在 docs/GETTING_STARTED.md,但该文件内容未包含在给定材料中,因此无法据此提供经过验证的安装命令。开始前还需为所用功能准备 Groq、ElevenLabs、Qdrant Cloud、Together AI 和 WhatsApp API 的访问配置;Google Cloud Run 仅在需要云端部署时使用。

如何使用这个 Agent?

先按项目的入门文档完成虚拟环境、依赖与 .env 配置,再启动 LangGraph 应用,并通过 WhatsApp API 将其连接到 WhatsApp。随后可从手机发送文字、语音或图片,Ava 会分别调用对话模型、Whisper 或视觉模型处理输入,并返回文字、语音便笺或生成图片。若不使用 WhatsApp,可按课程内容通过 Chainlit 创建聊天界面;若需公网运行,可将容器部署到 Google Cloud Run。给定材料没有提供启动命令、Webhook 配置、端口、容器命令或首个 API 调用示例,因此这些步骤不能进一步写成可验证的复制粘贴指令。

常见问题

可以完全免费运行吗?
项目说明可以在本地计算机免费运行,而且 Groq、ElevenLabs、Qdrant Cloud 和 Together AI 的免费额度足以开始实验。部署到 Google Cloud Run 后则可能产生费用;新账户可获得 300 美元免费额度。
它需要哪些外部账户或凭据?
完整功能涉及 WhatsApp API、Groq、Qdrant、ElevenLabs 和 Together AI。所提供材料没有列出具体凭据名称、申请步骤或所需 WhatsApp 权限。
Ava 能处理哪些消息类型?
它可以接收和发送 WhatsApp 消息、理解语音和图片、返回语音便笺,并发送活动更新及生成的图片。
它是否已经证明适合生产环境?
课程宣称教授生产就绪的 WhatsApp 智能体和 LangGraph 工作流,但给定材料没有提供负载测试、可靠性指标、安全审计、监控或正式支持承诺。
某个供应商不可用时会怎样?
材料没有说明降级或重试策略。依赖的服务分别承担模型推理、长期记忆、语音合成和图片生成,因此对应服务故障可能使相关能力不可用。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents