开发与工程 open-webuiarxiv-searchcomfyuiollamaimage-generationmusic-generationmulti-agentsemantic-routing

Open WebUI Tools Collection

一套模块化的 Open WebUI 工具、函数管道与过滤器合集,将你的 Open WebUI 实例扩展为集学术检索、图像/音乐/视频生成与自主智能体于一体的 AI 工作站。

FollowAgents 评估 · FARS-2.1
不推荐
48/ 100 五分制 2.4 / 5
1 2 3 4 5 6
1信任安全8 / 29 · 1.4/5

证据仅显示各工具通过 Valves 配置 API 密钥并调用外部服务,README 未说明工具网络范围最小化、是否需要用户确认、数据流向与回滚手段;工具源码本身未在本次证据中出现,无法核实敏感数据处理与依赖锁定,均记低分。SECURITY.md 提供私人漏洞报告渠道,属加分项但不提升未证实的实施细节。扣分点:无回滚机制、无默认权限声明、无用户确认流程。

2可靠稳定9 / 14 · 3.2/5

tests/ 下 Atlas Cloud 与 MiniMax 两个工具的单元测试覆盖默认值、参数钳制、错误路径(缺密钥、预测失败均返回明确错误信息并触发 error status),显示失败消息处理认真;但 30+ 组件中仅 2 个有测试,自一致性证据只覆盖局部。扣分点:绝大多数工具无测试佐证。

3适用触发9 / 18 · 2.5/5

README 按学术、创意、代理自治等场景组织工具并给出前置条件(ComfyUI、Perplexica、Mopidy、API key),受众与环境适配描述较清楚;但各工具触发精度与能力边界(如结果数量、失败行为)大多只有一句话描述,Planner Agent v3 等核心代理的边界未说明。扣分点:触发词与能力边界缺乏系统说明。

4规范维护10 / 18 · 2.8/5

信息架构良好:目录、目录表、逐工具配置文档齐备;安装说明覆盖 Hub 与手动两种方式;MIT 许可证文件完整(版权人 Juan Jose Soliz Priore,与 Haervwe 身份关系未说明,扣一分于维护责任之外);SECURITY.md 明确单人维护、48 小时响应承诺。扣分点:无 CHANGELOG/版本号、已知限制章节缺失、README 中部分文档(如 Cloudflare、SearxNG)列于目录但正文节段在提供的文件中被截断。

5有效结果9 / 13 · 3.5/5

工具输出被设计为 markdown 图片/视频链接、HTML embed 与引用元数据,测试证实输出格式可验证;20+ 工具填补 Open WebUI 检索、媒体生成、路由等空白,边际价值明显;多数工具免 API key 或仅需免费 key,成本收益合理。扣分点:实际输出质量依赖未提供的工具源码,无法在静态审查中确认。

6证据核验3 / 8 · 1.9/5

README 的能力声明(如'实时状态''进度更新')大部分无法在提供的证据中追溯;仅有两个工具的测试可交叉印证其行为;未区分事实与推断的说明文档风格,且部分目录条目与正文截断不一致。扣分点:声明可追溯性与跨源印证薄弱。

证据充分度: 评估于 2026年9月7日 审查版本 a94660737737
源码中未见的安全控制:回滚或恢复路径
使用前请注意
  • 本次审查仅基于 README、LICENSE、SECURITY.md 与两个测试文件;绝大多数工具源码未在证据中出现,安全结论仅属静态低置信推断。
  • API 密钥类工具(YouTube、Pexels、Cloudflare、HF 等)的密钥存储与传输方式需在部署前人工审阅对应 .py 源码。
  • Planner Agent v3 等自治代理的能力边界、失败行为与外部副作用未见文档,启用前应先在隔离环境验证。
  • 项目为单人业余维护,无版本化发布与变更日志,更新需自行核对提交差异。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Haervwe/open-webui-tools 是一个面向 Open WebUI(0.6.0+)的模块化扩展合集,包含 20 多个专用工具(Tools)、函数管道(Function Pipes)和过滤器(Filters),以 MIT 许可发布。工具层覆盖 arXiv 论文检索、Perplexica 网络搜索、Pexels/YouTube/SearxNG 媒体搜索、X(Twitter)数据查询、服务状态检查,以及基于 ComfyUI、Hugging Face、Cloudflare Workers AI、Atlas Cloud 等后端的图像、音乐(ACE Step 1.5)和视频(WAN 2.2、Google Veo)生成。函数管道层包括 Planner Agent v3 自主智能体(支持任务分解、子智能体委派、并行执行、MCP 服务器与可视化执行跟踪)、arXiv Research MCTS、多模型对话和 Letta Agent 集成。过滤器层提供 Semantic Router 智能模型选择、Prompt Enhancer、Doodle Paint 画布等。部署边界明确:所有组件作为 Python 文件安装进 Open WebUI 的 Workspace,依赖 Open WebUI 运行时及各工具声明的第三方服务与 API 密钥,不能脱离 Open WebUI 独立运行。

该合集以 .py 文件形式安装到 Open WebUI 的 Workspace > Tools / Functions / Filters 中。工具类组件通过 Open WebUI 的工具调用机制读取用户请求并调用外部 API:arXiv Search 直接检索 arXiv.org(无需密钥)、Perplexica Search 调用自托管的 Perplexica API 并生成引用、Pexels/YouTube/Xquik/OutageDeck/OpenWeatherMap 各自调用对应 API 并在聊天中渲染嵌入内容。生成类工具将提示词提交到 ComfyUI 的 HTTP + WebSocket API(默认 WAN 2.2 文生视频工作流、Qwen Edit 2509 图像编辑、ACE Step 1.5 音乐),等待任务完成后将产物上传到 Open WebUI 存储并以 HTML 嵌入播放器展示。Planner Agent v3 管道将复杂请求分解为依赖感知的任务树,通过 asyncio.gather 并行执行工具调用与子智能体任务(网页搜索、图像生成、知识库 RAG、代码解释器、终端代理),支持 MCP 服务器、JSON 文件状态持久化、plan_approval/ask_user 等交互式 UI 弹窗,并输出实时 HTML 执行跟踪界面。Semantic Router 过滤器根据输入进行智能模型路由,其他过滤器在消息前后处理文档、思考标签与引用。

  1. 研究人员在 Open WebUI 中需要不离开聊天即可检索 arXiv 论文并开展 MCTS 深度文献调研
  2. 内容创作者希望在对话中直接生成图像、编辑图片(Qwen Edit 2509 多图风格迁移)并内嵌展示结果
  3. 音乐人式用户想通过标签与歌词用 ACE Step 1.5 生成可控制调性、BPM 和语言的曲目
  4. 需要自动化工作流的进阶用户希望 Planner Agent v3 自主拆解任务、并行调度搜索/图像/终端子智能体并可视化跟踪进度
  5. 自托管 Perplexica 的用户想让聊天模型直接获得带引用来源的实时网络搜索能力
  6. 多模型用户希望用 Semantic Router 过滤器按请求内容自动选择合适的模型

这个 Agent 有哪些优点和局限?

优点
  • 覆盖面极广:一个仓库同时提供学术检索、网络搜索、图像/音乐/视频生成、自主智能体和模型路由,避免在多个项目间拼凑
  • Planner Agent v3 具备依赖感知任务树、asyncio 并行执行、MCP 支持和实时 HTML 执行跟踪,在 Open WebUI 生态内属先进的智能体实现
  • 多个组件零配置即用:arXiv Search 和 OutageDeck 无需 API 密钥,ComfyUI 工作流 JSON 随仓库附带,降低起步门槛
  • 细粒度 VRAM 管理:多数生成工具支持可选的 Ollama 模型卸载,适合显存有限的本地部署
局限
  • 深度绑定 Open WebUI 运行时(作为 Workspace 工具/管道/过滤器安装),无法在 ChatGPT、Claude 等其他平台直接复用
  • 许多核心功能依赖外部服务与密钥:Perplexica、ComfyUI、Ollama 需自托管,Pexels/YouTube/Hugging Face/Atlas Cloud/MiniMax/Google 需分别申请 API key,维护成本分散
  • 并行执行模式在工具间存在有状态依赖时可能引发外部竞态,README 明确警告复杂依赖工作流需谨慎并可能需要异步数据库
  • Google Veo 图生视频仅支持单张图片输入,Flux Kontext 多图支持尚未实现,部分能力存在文档化限制

如何安装或部署这个 Agent?

方式一(推荐):访问 https://openwebui.com/u/Haervwe,浏览合集并点击所需工具的 "Get",按 Open WebUI 内的安装提示完成安装。方式二(手动):从仓库的 tools/、functions/、filters/ 目录复制对应 .py 文件,进入 Open WebUI 的 Workspace > Tools / Functions / Filters,粘贴代码,填写名称和描述后保存。前提条件:Open WebUI 0.6.0+、Python 3.8+;生成类工具需本地运行 ComfyUI 并导入 Extras/ 目录中的工作流 JSON(如 ace_step_api.、video_wan2_2_14B_t2v.、image_qwen_image_edit_2509_api_owui.);Perplexica 相关组件需自托管 Perplexica 实例。

如何使用这个 Agent?

安装后在 Open WebUI 中启用对应工具/管道/过滤器,并在各组件的 Valves 设置中填入所需配置:如 Pexels 需 PEXELS_API_KEY、YouTube 需 YOUTUBE_API_KEY、Hugging Face 图像生成需 HF API key、Atlas Cloud 需 ATLASCLOUD_API_KEY、MiniMax 管道需 MINIMAX_API_KEY、Google Veo 管道需 GOOGLE_API_KEY;Perplexica 组件需设置 perplexica_api_url(默认 http://localhost:3001)及聊天/嵌入模型。ComfyUI 类工具需将 comfyui_api_url 设为 ComfyUI 服务器地址(默认 http://localhost:8188)。随后用自然语言调用,例如:"Search for recent papers about tree of thought"、"Generate an image of a serene mountain landscape at sunset"、"Generate a cyberpunk, darkwave song in E minor, 140 BPM"。Planner Agent v3 需在 Valves 中必填 PLANNER_MODEL(Admin Panel 中的基础模型 ID),可选配置 SUBAGENT_MODELS、ENABLE_PLAN_APPROVAL、YOLO_MODE 等。

这个 Agent 与同类方案有什么区别?

README 将 Perplexica 定位为自托管的开源 AI 搜索引擎、Perplexity AI 的替代品,本仓库的 Perplexica Search/Pipe 即构建于其上;生成类工具则与直接使用 AUTOMATIC1111、ComfyUI、OpenAI DALL·E 等后端形成对比,本仓库通过 Open WebUI 原生中间件封装这些后端。

常见问题

必须付费吗?
仓库本身 MIT 许可免费。arXiv Search 和 OutageDeck 状态工具无需任何密钥;但 Pexels、YouTube、Hugging Face、Cloudflare、Atlas Cloud、MiniMax、OpenWeatherMap、Google Veo 等组件需各自申请 API 密钥,部分服务(如 OpenWeatherMap One Call 3.0、Google Veo)可能涉及订阅或付费。
能否脱离 Open WebUI 使用?
不能直接使用。所有组件均按 Open WebUI 的 Tools/Functions/Filters 接口编写,依赖其 Workspace、Valves、事件发射器和存储后端,没有提供独立的 CLI 或库形态。
硬件要求如何?
取决于启用的组件:纯检索类工具几乎无硬件要求;ComfyUI 图像/音乐/视频生成和本地 Ollama 模型需要 GPU 显存,工具提供了可选的 Ollama 模型卸载和 ComfyUI-Unload-Model 节点来缓解显存争用。
Planner Agent v3 的并行模式安全吗?
子智能体间的异步状态有保护机制,但 README 警告:同一轮内工具间存在状态依赖(如一个工具依赖另一个工具创建的文件)时并行可能导致外部竞态;大规模全并行时可能需要异步数据库以避免死锁。
如何处理安装后不显示嵌入内容的情况?
以 Native Image Generator 为例:当 emit_embeds 为 True 但事件发射器不可用时,只会返回下载 URL 而不内嵌显示。检查 Open WebUI 版本(建议 0.6.0+)和组件的 Valves 配置即可排查。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents