MiroFlow 研究智能体
面向复杂问题、文件分析与未来事件预测的多步骤研究框架。
README 明示 OpenRouter 密钥、联网研究能力及 Python、文件读取、搜索、音频、视觉和 E2B 等工具,并将项目归因于 MiroMind Team;因此来源归属和部分数据流可见。扣分在于材料未说明工具权限边界、逐项用户确认、数据保留或传输政策、密钥保护措施、外部副作用控制及回滚机制。依赖声明包含版本约束且 CI 会安装依赖,但大量依赖仅设下限或完全未固定,也没有依赖审计、锁文件或漏洞缓解证据。
README、项目元数据和 CI 对 Python 3.12、uv 及基本安装流程大体一致,并描述限流和不稳定网络下的容错设计;依赖来自常见包生态且给出了约束。扣分在于没有展示相关实现或测试,项目包版本 0.1.0 与 README 所述 MiroFlow v0.3 不一致,故不能充分确认自洽性;失败处理仅有检查 API 密钥和依赖的笼统提示,缺少具体错误目录、诊断步骤和恢复说明。
材料清楚面向复杂互联网研究、未来事件预测、文档分析和基准复现,并列出多模型与多工具支持;命令行任务和配置文件提供了较明确的调用入口,Linux 与 macOS、Python 3.12 和 uv 的环境要求也很清楚。扣分在于未定义不适用场景、安全边界或工具选择限制,多模型配置细节被指向外部文档,Windows、资源需求及不同部署环境的适配说明不完整。
README 具有完整目录、快速开始、功能、基准、FAQ、贡献和许可证结构;安装步骤可直接操作,Apache-2.0 全文存在,因此信息架构、安装说明和许可证获得高分。示例和 FAQ 有帮助但覆盖面有限;已知限制几乎未集中说明。README 宣称 v0.3,而 pyproject 仍为 0.1.0 且包名为 run-agent,削弱命名和版本稳定性。更新记录、Issues、Pull Requests、Discord、网站支持及团队署名提供维护路径,但发布者身份未获企业注册验证,且没有正式维护者名单或明确支持承诺。
快速开始给出具体任务与预期 boxed 答案,框架还整合多模型、联网研究、文件处理、工具调用和分层子代理,对复杂研究任务具有明显的组合价值。扣分在于输出格式、引用规范、报告结构和下游集成契约没有系统说明;成本效益主要依赖单张 RTX 4090、开源工具和基准成绩等陈述,未提供 API 消耗、延迟、硬件成本或任务级预算数据。
基准名称、分数、日期、排行榜、公开轨迹和复现文档均被具体指出,主张具有一定可追踪性。扣分在于所给静态文件没有包含评测脚本、原始结果、方法细节或独立来源,跨来源佐证主要是 README 自身引用;“可复现”“可靠”“最先进”和“成本有效”等事实性结论与营销性判断未被清晰区分。
- 该代理可联网并调用 Python、文件读取、搜索、视觉及远程执行类工具;在隔离环境中部署,并在授予文件、网络和执行权限前审查实际配置。
- 不要把 API 密钥提交到版本控制;现有材料只说明写入 .env,未说明密钥存储、日志脱敏、数据保留或第三方传输政策。
- 基准与可靠性结论在本次静态材料中主要是项目方自述;采用前应按固定修订版复核评测脚本、原始轨迹、模型配置和成本。
- 依赖大多未完全固定,且未展示安全扫描或漏洞处理流程;生产部署前应使用锁定依赖并完成供应链审计。
- README 的 v0.3、pyproject 的 0.1.0 和 run-agent 包名存在版本及命名偏差,自动化部署不应仅依赖展示版本。
这个 Agent 能做什么,适合哪些场景?
MiroFlow 是 MiroMind Research Agent Project 的开源研究智能体框架,主要处理需要多步检索、推理和工具调用的复杂任务。它支持多轮对话和分层子智能体编排,并可使用 GPT、Claude、Gemini、Qwen 等模型。工具层包含 Google Search、Python、文件读取、音频转写、推理、视觉问答和 E2B 等能力,其中多个工具通过 MCP server 实现。用户可以从命令行运行配置好的研究任务,也可以使用项目提供的 Web 演示;示例流程会读取本地 XLSX 文件并返回答案。项目面向 Linux 和 macOS 自托管环境,需要 Python 3.12 以上版本、uv,以及快速开始流程所用的 OpenRouter API 密钥。
用户通过 uv run main.py trace 选择配置并提交自然语言任务,也可用 --task_file_name 指定本地文件。MiroFlow 随后按照配置进行多轮推理,并可分层调度子智能体;执行期间能够调用 searching_mcp_server.py 进行 Google Search、reading_mcp_server.py 读取文件、python_server.py 执行 Python、audio_mcp_server.py 转写音频、vision_mcp_server.py 处理视觉问答,以及 reasoning_mcp_server.py 辅助推理。框架支持 GPT、Claude、Gemini、Qwen 等模型,并针对限流 API 和不稳定网络提供并发管理与容错设计。最终产物是任务答案和可用于轨迹收集、评测复现的执行过程;快速开始示例从 XLSX 文件中找出符合条件的首个国家并输出 \boxed{Congo Democratic Republic}。
- 研究人员需要围绕开放式问题执行多轮网络检索、推理并汇总最终答案。
- 预测分析团队需要调查未来事件,并希望复现 FutureX 上的研究智能体流程。
- 评测团队需要在 GAIA、HLE、BrowseComp 或 xBench-DeepSearch 上运行和比较智能体配置。
- 分析人员需要让智能体读取 XLSX 等本地文件,再结合 Python 或检索工具回答具体问题。
- 开发团队希望在单一框架中试验 GPT、Claude、Gemini、Qwen 或开源 MiroThinker 模型。
- 需要处理混合输入的团队希望组合文件读取、音频转写和视觉问答工具完成研究任务。
这个 Agent 有哪些优点和局限?
- 覆盖完整研究链路:多轮推理、分层子智能体编排、网络搜索、文件读取、Python、音频转写和视觉问答可在同一框架内组合。
- 模型选择面较宽,明确支持 GPT、Claude、Gemini、Qwen 等模型,并可搭配开源 MiroThinker。
- 提供具体基准结果和复现文档;表中报告 GAIA Validation 82.4%、HLE 27.2%、BrowserComp-ZH 47.1% 和 xBench-DeepSearch 72.0%。
- 强调并发管理与容错,目标是应对限流 API 和不稳定网络下的复杂任务执行。
- 文档称基于 MiroThinker 的研究智能体服务可在单张 RTX 4090 上运行。
- 快速开始依赖 OpenRouter API 密钥,因此默认路径需要外部服务、网络连接,并可能产生模型调用费用。
- 官方前提仅列出 Linux 和 macOS,没有提供 Windows 支持证据。
- 要求 Python 3.12 以上版本和
uv,现有 Python 环境可能需要升级或调整依赖管理流程。 - 不同模型和工具可能存在行为、成本及能力差异;来源只说明可配置其他模型,没有给出直接使用 OpenAI 或 Anthropic 原生密钥的步骤。
- 虽然提供在线 Demo,来源没有给出 MiroFlow 本地 Web UI 的安装或启动命令。
如何安装或部署这个 Agent?
前提条件是 Linux 或 macOS、Python 3.12 以上版本和 uv。执行:
git clone https://github.com/MiroMindAI/MiroFlow && cd MiroFlow
uv sync
cp .env.template .env随后编辑 .env,加入 OPENROUTER_API_KEY。源码采用 Apache-2.0 许可证。
如何使用这个 Agent?
安装并配置密钥后,运行 README 提供的首个任务:
uv run main.py trace --config_file_name=agent_quickstart_reading --task="What is the first country listed in the XLSX file that have names starting with Co?" --task_file_name="data/FSI-2023-DOWNLOAD.xlsx"该命令使用 agent_quickstart_reading 配置读取仓库内的 XLSX 文件,预期返回 \boxed{Congo Democratic Republic}。若执行失败,先检查 .env 中的 OpenRouter 密钥和 uv sync 安装的依赖。项目还提供在线研究助手 Demo,但来源未给出本地 Web UI 的启动命令。
这个 Agent 与同类方案有什么区别?
仓库给出的评测表显示,MiroFlow 在 GAIA Validation 为 82.4%,高于表中的 OpenAI Deep Research 67.4%、WebSailor-72B 55.4% 和 Manus 73.3%;在 xBench-DeepSearch 为 72.0%,高于表中的 Kimi Researcher 69.0%、WebSailor-72B 55.0% 和 DeepSeek v3.1 71.2%。但它并非每项都领先:BrowserComp-EN 为 33.2%,低于 OpenAI Deep Research 的 51.5%;HLE-Text 为 29.5%,略低于 DeepSeek v3.1 的 29.8%。这些数字适合评估所列基准表现,不足以单独证明真实业务中的成本、延迟或可靠性优势。
常见问题
开始使用需要哪些凭据?
OPENROUTER_API_KEY 写入 .env。来源没有提供直接配置 OpenAI 或 Anthropic 原生密钥的命令。能否完全在本地运行?
它可以分析本地文件吗?
--task_file_name 读取 XLSX 文件,工具列表还明确包含 File Reading 和 Python。来源没有列出所有支持的文件格式。