Open WebUI Tools Collection
一套模块化的 Open WebUI 工具、函数管道与过滤器合集,将你的 Open WebUI 实例扩展为集学术检索、图像/音乐/视频生成与自主智能体于一体的 AI 工作站。
证据仅显示各工具通过 Valves 配置 API 密钥并调用外部服务,README 未说明工具网络范围最小化、是否需要用户确认、数据流向与回滚手段;工具源码本身未在本次证据中出现,无法核实敏感数据处理与依赖锁定,均记低分。SECURITY.md 提供私人漏洞报告渠道,属加分项但不提升未证实的实施细节。扣分点:无回滚机制、无默认权限声明、无用户确认流程。
tests/ 下 Atlas Cloud 与 MiniMax 两个工具的单元测试覆盖默认值、参数钳制、错误路径(缺密钥、预测失败均返回明确错误信息并触发 error status),显示失败消息处理认真;但 30+ 组件中仅 2 个有测试,自一致性证据只覆盖局部。扣分点:绝大多数工具无测试佐证。
README 按学术、创意、代理自治等场景组织工具并给出前置条件(ComfyUI、Perplexica、Mopidy、API key),受众与环境适配描述较清楚;但各工具触发精度与能力边界(如结果数量、失败行为)大多只有一句话描述,Planner Agent v3 等核心代理的边界未说明。扣分点:触发词与能力边界缺乏系统说明。
信息架构良好:目录、目录表、逐工具配置文档齐备;安装说明覆盖 Hub 与手动两种方式;MIT 许可证文件完整(版权人 Juan Jose Soliz Priore,与 Haervwe 身份关系未说明,扣一分于维护责任之外);SECURITY.md 明确单人维护、48 小时响应承诺。扣分点:无 CHANGELOG/版本号、已知限制章节缺失、README 中部分文档(如 Cloudflare、SearxNG)列于目录但正文节段在提供的文件中被截断。
工具输出被设计为 markdown 图片/视频链接、HTML embed 与引用元数据,测试证实输出格式可验证;20+ 工具填补 Open WebUI 检索、媒体生成、路由等空白,边际价值明显;多数工具免 API key 或仅需免费 key,成本收益合理。扣分点:实际输出质量依赖未提供的工具源码,无法在静态审查中确认。
README 的能力声明(如'实时状态''进度更新')大部分无法在提供的证据中追溯;仅有两个工具的测试可交叉印证其行为;未区分事实与推断的说明文档风格,且部分目录条目与正文截断不一致。扣分点:声明可追溯性与跨源印证薄弱。
- 本次审查仅基于 README、LICENSE、SECURITY.md 与两个测试文件;绝大多数工具源码未在证据中出现,安全结论仅属静态低置信推断。
- API 密钥类工具(YouTube、Pexels、Cloudflare、HF 等)的密钥存储与传输方式需在部署前人工审阅对应 .py 源码。
- Planner Agent v3 等自治代理的能力边界、失败行为与外部副作用未见文档,启用前应先在隔离环境验证。
- 项目为单人业余维护,无版本化发布与变更日志,更新需自行核对提交差异。
这个 Agent 能做什么,适合哪些场景?
Haervwe/open-webui-tools 是一个面向 Open WebUI(0.6.0+)的模块化扩展合集,包含 20 多个专用工具(Tools)、函数管道(Function Pipes)和过滤器(Filters),以 MIT 许可发布。工具层覆盖 arXiv 论文检索、Perplexica 网络搜索、Pexels/YouTube/SearxNG 媒体搜索、X(Twitter)数据查询、服务状态检查,以及基于 ComfyUI、Hugging Face、Cloudflare Workers AI、Atlas Cloud 等后端的图像、音乐(ACE Step 1.5)和视频(WAN 2.2、Google Veo)生成。函数管道层包括 Planner Agent v3 自主智能体(支持任务分解、子智能体委派、并行执行、MCP 服务器与可视化执行跟踪)、arXiv Research MCTS、多模型对话和 Letta Agent 集成。过滤器层提供 Semantic Router 智能模型选择、Prompt Enhancer、Doodle Paint 画布等。部署边界明确:所有组件作为 Python 文件安装进 Open WebUI 的 Workspace,依赖 Open WebUI 运行时及各工具声明的第三方服务与 API 密钥,不能脱离 Open WebUI 独立运行。
该合集以 .py 文件形式安装到 Open WebUI 的 Workspace > Tools / Functions / Filters 中。工具类组件通过 Open WebUI 的工具调用机制读取用户请求并调用外部 API:arXiv Search 直接检索 arXiv.org(无需密钥)、Perplexica Search 调用自托管的 Perplexica API 并生成引用、Pexels/YouTube/Xquik/OutageDeck/OpenWeatherMap 各自调用对应 API 并在聊天中渲染嵌入内容。生成类工具将提示词提交到 ComfyUI 的 HTTP + WebSocket API(默认 WAN 2.2 文生视频工作流、Qwen Edit 2509 图像编辑、ACE Step 1.5 音乐),等待任务完成后将产物上传到 Open WebUI 存储并以 HTML 嵌入播放器展示。Planner Agent v3 管道将复杂请求分解为依赖感知的任务树,通过 asyncio.gather 并行执行工具调用与子智能体任务(网页搜索、图像生成、知识库 RAG、代码解释器、终端代理),支持 MCP 服务器、JSON 文件状态持久化、plan_approval/ask_user 等交互式 UI 弹窗,并输出实时 HTML 执行跟踪界面。Semantic Router 过滤器根据输入进行智能模型路由,其他过滤器在消息前后处理文档、思考标签与引用。
- 研究人员在 Open WebUI 中需要不离开聊天即可检索 arXiv 论文并开展 MCTS 深度文献调研
- 内容创作者希望在对话中直接生成图像、编辑图片(Qwen Edit 2509 多图风格迁移)并内嵌展示结果
- 音乐人式用户想通过标签与歌词用 ACE Step 1.5 生成可控制调性、BPM 和语言的曲目
- 需要自动化工作流的进阶用户希望 Planner Agent v3 自主拆解任务、并行调度搜索/图像/终端子智能体并可视化跟踪进度
- 自托管 Perplexica 的用户想让聊天模型直接获得带引用来源的实时网络搜索能力
- 多模型用户希望用 Semantic Router 过滤器按请求内容自动选择合适的模型
这个 Agent 有哪些优点和局限?
- 覆盖面极广:一个仓库同时提供学术检索、网络搜索、图像/音乐/视频生成、自主智能体和模型路由,避免在多个项目间拼凑
- Planner Agent v3 具备依赖感知任务树、asyncio 并行执行、MCP 支持和实时 HTML 执行跟踪,在 Open WebUI 生态内属先进的智能体实现
- 多个组件零配置即用:arXiv Search 和 OutageDeck 无需 API 密钥,ComfyUI 工作流 JSON 随仓库附带,降低起步门槛
- 细粒度 VRAM 管理:多数生成工具支持可选的 Ollama 模型卸载,适合显存有限的本地部署
- 深度绑定 Open WebUI 运行时(作为 Workspace 工具/管道/过滤器安装),无法在 ChatGPT、Claude 等其他平台直接复用
- 许多核心功能依赖外部服务与密钥:Perplexica、ComfyUI、Ollama 需自托管,Pexels/YouTube/Hugging Face/Atlas Cloud/MiniMax/Google 需分别申请 API key,维护成本分散
- 并行执行模式在工具间存在有状态依赖时可能引发外部竞态,README 明确警告复杂依赖工作流需谨慎并可能需要异步数据库
- Google Veo 图生视频仅支持单张图片输入,Flux Kontext 多图支持尚未实现,部分能力存在文档化限制
如何安装或部署这个 Agent?
方式一(推荐):访问 https://openwebui.com/u/Haervwe,浏览合集并点击所需工具的 "Get",按 Open WebUI 内的安装提示完成安装。方式二(手动):从仓库的 tools/、functions/、filters/ 目录复制对应 .py 文件,进入 Open WebUI 的 Workspace > Tools / Functions / Filters,粘贴代码,填写名称和描述后保存。前提条件:Open WebUI 0.6.0+、Python 3.8+;生成类工具需本地运行 ComfyUI 并导入 Extras/ 目录中的工作流 JSON(如 ace_step_api.、video_wan2_2_14B_t2v.、image_qwen_image_edit_2509_api_owui.);Perplexica 相关组件需自托管 Perplexica 实例。
如何使用这个 Agent?
安装后在 Open WebUI 中启用对应工具/管道/过滤器,并在各组件的 Valves 设置中填入所需配置:如 Pexels 需 PEXELS_API_KEY、YouTube 需 YOUTUBE_API_KEY、Hugging Face 图像生成需 HF API key、Atlas Cloud 需 ATLASCLOUD_API_KEY、MiniMax 管道需 MINIMAX_API_KEY、Google Veo 管道需 GOOGLE_API_KEY;Perplexica 组件需设置 perplexica_api_url(默认 http://localhost:3001)及聊天/嵌入模型。ComfyUI 类工具需将 comfyui_api_url 设为 ComfyUI 服务器地址(默认 http://localhost:8188)。随后用自然语言调用,例如:"Search for recent papers about tree of thought"、"Generate an image of a serene mountain landscape at sunset"、"Generate a cyberpunk, darkwave song in E minor, 140 BPM"。Planner Agent v3 需在 Valves 中必填 PLANNER_MODEL(Admin Panel 中的基础模型 ID),可选配置 SUBAGENT_MODELS、ENABLE_PLAN_APPROVAL、YOLO_MODE 等。
这个 Agent 与同类方案有什么区别?
README 将 Perplexica 定位为自托管的开源 AI 搜索引擎、Perplexity AI 的替代品,本仓库的 Perplexica Search/Pipe 即构建于其上;生成类工具则与直接使用 AUTOMATIC1111、ComfyUI、OpenAI DALL·E 等后端形成对比,本仓库通过 Open WebUI 原生中间件封装这些后端。