Oumi 端到端基础模型平台

从数据准备、SFT/DPO/GRPO 训练到评测与部署的一站式开源平台,覆盖 10M 到 400B+ 参数模型。

源仓库
oumi-ai/oumi
Star 数
★ 9.4k
最近更新
今天
License
Apache-2.0
主语言
Python

30 秒速览

运行形态
命令行工具代码库 / SDK
可在哪里用
通用 · 跨平台Claude Code · OpenAI APIChatGPT · Claude API(部分支持)
费用
软件免费,模型调用费用自付
上手难度
高 · 需要较重的基础设施
开始前需要
PythonPyTorchDocker(可选安装方式)Shell / 命令行网络访问本地文件系统MCP Server
典型场景
团队要为自己的业务场景微调一个 Qwen3 或 Gemma 系列模型,希望直接用现成 YAML 配方跑 LoRA/QLoRA,而不是重写训练脚本。
不适合
  • 只想在网页里聊天、不打算写配置或跑命令的个人用户
  • 完全没有 GPU 环境、只做小规模试用的团队
  • 需要商业 SLA 与官方支持的闭源生产环境

这个 Agent 能做什么,适合哪些场景?

Oumi 是一个完全开源、覆盖基础模型全生命周期的平台:数据合成与清洗、预训练与微调、评测、推理与部署。它提供统一的 oumi CLI,用 YAML 配方(recipes)驱动训练、评测、推理任务,避免用户自己编写训练循环和数据管道。训练侧支持 SFT、LoRA、QLoRA、DPO、GRPO 等方法,并通过 FSDP、DeepSpeed、DDP 做分布式扩展;推理侧集成 vLLM、SGLang 等引擎,也可通过 oumi deploy 部署到专用推理端点。除了文本模型,它还支持视觉语言模型(VLM)和工具调用型 Agent 模型:可以构建数据库、HTTP 端点、查表、模拟等可执行工具环境,并用 verl GRPO 在这些环境上做强化学习。评测方面提供标准基准测试以及多准则 RubricJudge、LLM-as-a-Judge 评判。运行时既能跑在笔记本上,也能通过 oumi launch 提交到 AWS、Azure、GCP、Lambda、Modal、Slurm 等集群或云平台。

Oumi 以 oumi 命令行工具为核心接口。用户编写或复用 configs/recipes 下的 YAML 配置,然后执行 oumi train -c <config> 启动训练(支持 SFT、LoRA、QLoRA、DPO、GRPO,底层为 PyTorch,可配合 FSDP/DeepSpeed/DDP);执行 oumi evaluate -c <config> 在标准基准或自定义评判器上评测模型;执行 oumi infer -c <config> --interactive 做交互式推理,可选用 vLLM、SGLang、Fireworks、OpenRouter 等引擎。数据侧,它读取原始语料,调用 LLM 评判器(包括 RubricJudge)做合成与筛选,生成多轮工具调用对话等训练数据。Agent 化训练时,它管理可执行的工具环境(数据库、HTTP 端点、查表、模拟),并用 verl GRPO 在这些环境中做强化学习。部署侧,oumi deploy 把模型发布到 Fireworks、Parasail 等专用推理端点;oumi launch up 把训练任务提交到云平台;oumi-mcp 提供 MCP 服务器供 Claude、Cursor 等客户端调用。oumi analyze 用于分析,/configs/recipes 则收录了 Qwen、Gemma、Llama、DeepSeek、GLM、Phi、OLMo、gpt-oss、Falcon 等模型的现成配置。

  1. 团队要为自己的业务场景微调一个 Qwen3 或 Gemma 系列模型,希望直接用现成 YAML 配方跑 LoRA/QLoRA,而不是重写训练脚本。
  2. 研究者要在多台 GPU 或云集群上做可复现的强化学习实验(GRPO),并需要 FSDP/DeepSpeed 这样的分布式支持。
  3. 开发者要训练一个会调用工具的 Agent 模型,需要构造数据库、HTTP 或查表类工具环境,并在其上做强化学习。
  4. 数据团队要用 LLM-as-a-Judge 或 RubricJudge 批量合成、筛选和清洗训练数据,包括视觉语言模型的数据整理。
  5. 工程团队要在本地或云上部署微调后的模型,通过 vLLM/SGLang 推理,或用 oumi deploy 发布到托管端点。
  6. 已经用 IDE 里的 AI 助手(如 Claude、Cursor)工作的开发者,想通过 oumi-mcp 这个 MCP 服务器直接驱动 Oumi 的任务流。

如何安装或部署这个 Agent?

README 推荐用 pip(uv)安装:

# 基础安装
uv pip install oumi

# 带 GPU 支持
uv pip install 'oumi[gpu]'

# 最新开发版
uv pip install git+https://github.com/oumi-ai/oumi.git

也提供 Docker 镜像与实验性的一键脚本:

docker pull ghcr.io/oumi-ai/oumi:latest
docker run --gpus all -it ghcr.io/oumi-ai/oumi:latest oumi --help
curl -LsSf https://oumi.ai/install.sh | bash

项目处于 beta 阶段,核心功能稳定,但部分高级功能可能变化;更完整的安装选项见官方安装文档。

如何使用这个 Agent?

基本流程是选一份 configs/recipes 下的 YAML 配置,用 oumi CLI 执行:

# 训练
oumi train -c configs/recipes/smollm/sft/135m/quickstart_train.yaml

# 评测
oumi evaluate -c configs/recipes/smollm/evaluation/135m/quickstart_eval.yaml

# 交互式推理
oumi infer -c configs/recipes/smollm/inference/135m_infer.yaml --interactive

把任务提交到云端时使用 oumi launch(示例);也可以把当前目录挂载进 Docker 后以 --config 方式训练:

oumi launch up -c configs/recipes/smollm/sft/135m/quickstart_gcp_job.yaml --resources.cloud aws
docker run --gpus all -v $(pwd):/workspace -it ghcr.io/oumi-ai/oumi:latest \
    oumi train --config /workspace/my_config.yaml

这个 Agent 有哪些优点和局限?

优点
  • 覆盖训练、评测、推理、合成数据、部署的完整流水线,一个 oumi CLI 加 YAML 配方即可上手,不必自写训练循环。
  • 训练方法齐全:SFT、LoRA、QLoRA、DPO、GRPO,并原生支持 FSDP、DeepSpeed、DDP 等分布式方案。
  • 支持在可执行工具环境(数据库、HTTP 端点、查表、模拟)上用 verl 做 GRPO 强化学习,面向工具调用型 Agent 模型。
  • 内置多准则 RubricJudge 与 LLM-as-a-Judge,兼顾标准基准测试与自定义评判。
  • 部署路径多样:vLLM/SGLang 本地推理、oumi deploy 发布专用端点、oumi-mcp 接入 Claude 与 Cursor,并可提交到 AWS/Azure/GCP/Lambda/Modal/Slurm。
  • Apache-2.0 许可,100% 开源,无厂商锁定。
局限
  • 项目仍处于 beta,README 明确指出部分高级功能可能随版本变化,生产采用需评估版本稳定性。
  • 完整能力依赖 GPU 与较大的 Python/PyTorch 环境,属于重型依赖,入门成本明显高于轻量工具。
  • 云端提交与专用端点部署依赖外部平台(AWS、Azure、GCP、Lambda、Modal、Slurm、Fireworks、Parasail 等)的账号与额度。
  • 模型覆盖虽广,但多数权重使用自定义许可(如 Llama、Gemma、Qwen),商用时需要逐个核对许可条款。
  • README 中大量更新条目日期在 2026 年,与实际发布节奏存在偏差,需要以 release 页面为准核实。

这个 Agent 与同类方案有什么区别?

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 形态 / 费用 Star 最近更新 主语言 完整支持的平台
Oumi 端到端基础模型平台 当前 58 · 缺口较多 命令行工具免费 + 模型费 ★ 9.4k 今天 Python Claude Code · OpenAI API
AI Agents 项目与教程集合 9 · 缺口较多 代码库 / SDK免费 + 模型费 ★ 2.9k 2 天前 Jupyter Notebook OpenAI API · Claude API
MARTI:多智能体强化学习训练与推理框架 36 · 缺口较多 命令行工具免费 ★ 560 1 个月前 Python —
AgentsMeetRL——智能体强化学习资源大全 29 · 缺口较多 Agent 插件 / 技能免费 ★ 1.9k 16 天前 HTML —

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
58/ 100 五分制 2.9 / 5
信任安全 12/29
可靠稳定 8/14
适用触发 14/18
规范维护 14/18
有效结果 7/13
证据核验 3/8
查看各维度的扣分理由
信任安全12 / 29 · 2.1/5

证据仅来自 README、LICENSE、SECURITY.md、pyproject.toml 与少量 CI/测试文件。least_privilege:README 展示 `oumi launch up` 可创建云资源、`oumi deploy` 可部署端点,但未说明所需最小权限或 IAM 范围,仅得 1。user_confirmation:CLI 训练/部署/云启动均无确认或 dry-run 说明,得 1。data_flow_transparency:README 提到 posthog 遥测依赖与 DO_NOT_TRACK 环境变量(测试中设置),但未在 README 说明数据流向,得 1。sensitive_data_handling:无任何密钥、凭据、PII 处理说明,得 1。dependency_security:pyproject 对多数依赖给出上下界并附注释解释 pin 原因,且存在 CodeQL 工作流,属中等水平,得 2。external_effects:训练/部署/云资源创建等外部副作用未描述回滚或影响范围,得 1。rollback:无回滚或恢复流程说明,得 1。source_attribution:LICENSE 为完整 Apache-2.0 并含版权归属,SECURITY.md 说明漏洞披露渠道,得 2。

可靠稳定8 / 14 · 2.9/5

self_consistency:README 的安装、CLI、recipes 路径与 pyproject 的入口点(oumi、oumi-mcp)一致,但 README 被截断,无法核对全部链接,得 2。dependency_availability:依赖均来自 PyPI 且带版本区间,注释解释了 omegaconf dev 版本与 lm_eval 上限的原因,得 2。failure_messages:README 提到 partial-failure 支持,但无错误信息或诊断示例,得 1。

适用触发14 / 18 · 3.9/5

audience_and_scenarios:README 明确面向研究者、企业、笔记本到集群到云的多场景,得 3。capability_boundaries:列出支持模型与训练方法,但未系统说明不支持的能力或边界,得 2。trigger_precision:作为框架/CLI,无触发条件或调用时机说明,得 1。environment_fit:覆盖 pip、Docker、安装脚本、多 Python 版本、多 GPU/云平台,得 3。

规范维护14 / 18 · 3.9/5

information_architecture:README 结构清晰(News/About/Getting Started/Usage/Examples),但文件被截断,得 2。install_notes:pip、uv、Docker、实验性安装脚本及 GPU 变体说明充分,得 3。naming_stability:CLI 命令与配置路径命名一致,但无稳定性承诺,得 2。examples_and_faq:大量 Colab notebook 与 recipes 表格,得 3。known_limitations:仅一句 beta 提示,无系统限制说明,得 1。license:完整 Apache-2.0 文本,得 3。versioning_changelog:News 段落列出多个版本发布与链接,得 3。maintenance_responsibility:SECURITY.md 说明团队响应流程,但发布者身份未验证,得 2。

有效结果7 / 13 · 2.7/5

output_usability:CLI 与 recipes 可直接产出训练/评估/推理结果,但无输出格式说明,得 2。marginal_value:整合训练、评估、部署、数据合成,相对零散工具链有增量价值,得 2。cost_benefit:依赖极重(torch、vllm、verl、deepspeed 等),资源与安装成本高,README 未讨论成本权衡,得 1。

证据核验3 / 8 · 1.9/5

claim_traceability:README 声称 SOTA、企业级、生产级可靠性,但未提供基准或证据链接,得 1。cross_source_corroboration:README 与 pyproject 在依赖和入口点上可互相印证,但安全与可靠性声明无第二来源,得 1。fact_inference_separation:README 将营销性表述与事实混排,未区分声明与证据,得 1。

风险与缓解建议
  • README 声称“生产级可靠性”“企业级”,但未提供基准、测试报告或可核验证据,应视为营销表述。
  • 云资源创建(oumi launch up)与端点部署(oumi deploy)缺少最小权限、确认步骤与回滚说明,实际使用前需自行评估权限与成本。
  • 依赖集极重(torch、vllm、verl、deepspeed 等),安装与运行成本高,且部分依赖使用 dev 版本或严格上限,可能引发冲突。
  • 发布者身份未经验证,维护责任与更新路径仅能依据仓库内 SECURITY.md 与发布记录推断。
  • README 文件在证据中被截断,部分链接与声明无法完整核对。
证据充分度:低 评估于 2026年10月1日 审查版本 310c4e9b35f7
查看完整评分方法 →

常见问题

需要 GPU 才能用吗?
训练和 GPU 推理需要 GPU,README 的安装说明提供了 uv pip install 'oumi[gpu]' 与带 --gpus all 的 Docker 路径;纯集成商业 API 的推理任务则可以不走本地 GPU。
用 Oumi 要额外付钱吗?
Oumi 本身以 Apache-2.0 开源发布,不收费;但调用 OpenAI、Anthropic、Vertex AI、Together、Fireworks 等商业 API,或使用 AWS/Azure/GCP 等云资源时,需自行承担相应费用。
能用它训练工具调用型 Agent 吗?
可以。README 说明支持工具调用 SFT/DPO、可执行工具环境(数据库、HTTP 端点、查表、模拟),以及基于 verl 的 GRPO 强化学习,并可做多轮工具调用对话的数据合成。
部署和线上服务怎么做?
可以用 vLLM、SGLang 做推理,用 oumi deploy 将模型发布到 Fireworks、Parasail 等专用推理端点;集群训练用 oumi launch up 提交到 AWS、Azure、GCP、Lambda 等。
支持哪些模型?
README 列出 Qwen(含 Qwen3、Qwen3.5、Qwen3-VL、Qwen3-Coder、QwQ)、Gemma(Gemma 3/4)、Llama(3.x/4)、DeepSeek R1、GLM、Phi、OLMo 3、gpt-oss、Falcon 等,并说明通过 Transformers 集成可扩展使用更多架构。
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents