Oumi 端到端基础模型平台
从数据准备、SFT/DPO/GRPO 训练到评测与部署的一站式开源平台,覆盖 10M 到 400B+ 参数模型。
- 源仓库
- oumi-ai/oumi
- Star 数
- ★ 9.4k
- 最近更新
- 今天
- License
- Apache-2.0
- 主语言
- Python
- FA 评分
- 58/100 · 缺口较多
30 秒速览
- 运行形态
- 可在哪里用
- 通用 · 跨平台Claude Code · OpenAI APIChatGPT · Claude API(部分支持)
- 费用
- 软件免费,模型调用费用自付
- 上手难度
- 高 · 需要较重的基础设施
- 开始前需要
- 典型场景
- 团队要为自己的业务场景微调一个 Qwen3 或 Gemma 系列模型,希望直接用现成 YAML 配方跑 LoRA/QLoRA,而不是重写训练脚本。
- 不适合
- 只想在网页里聊天、不打算写配置或跑命令的个人用户
- 完全没有 GPU 环境、只做小规模试用的团队
- 需要商业 SLA 与官方支持的闭源生产环境
- 源码审查
- 58/100 · 缺口较多
这个 Agent 能做什么,适合哪些场景?
Oumi 是一个完全开源、覆盖基础模型全生命周期的平台:数据合成与清洗、预训练与微调、评测、推理与部署。它提供统一的 oumi CLI,用 YAML 配方(recipes)驱动训练、评测、推理任务,避免用户自己编写训练循环和数据管道。训练侧支持 SFT、LoRA、QLoRA、DPO、GRPO 等方法,并通过 FSDP、DeepSpeed、DDP 做分布式扩展;推理侧集成 vLLM、SGLang 等引擎,也可通过 oumi deploy 部署到专用推理端点。除了文本模型,它还支持视觉语言模型(VLM)和工具调用型 Agent 模型:可以构建数据库、HTTP 端点、查表、模拟等可执行工具环境,并用 verl GRPO 在这些环境上做强化学习。评测方面提供标准基准测试以及多准则 RubricJudge、LLM-as-a-Judge 评判。运行时既能跑在笔记本上,也能通过 oumi launch 提交到 AWS、Azure、GCP、Lambda、Modal、Slurm 等集群或云平台。
Oumi 以 oumi 命令行工具为核心接口。用户编写或复用 configs/recipes 下的 YAML 配置,然后执行 oumi train -c <config> 启动训练(支持 SFT、LoRA、QLoRA、DPO、GRPO,底层为 PyTorch,可配合 FSDP/DeepSpeed/DDP);执行 oumi evaluate -c <config> 在标准基准或自定义评判器上评测模型;执行 oumi infer -c <config> --interactive 做交互式推理,可选用 vLLM、SGLang、Fireworks、OpenRouter 等引擎。数据侧,它读取原始语料,调用 LLM 评判器(包括 RubricJudge)做合成与筛选,生成多轮工具调用对话等训练数据。Agent 化训练时,它管理可执行的工具环境(数据库、HTTP 端点、查表、模拟),并用 verl GRPO 在这些环境中做强化学习。部署侧,oumi deploy 把模型发布到 Fireworks、Parasail 等专用推理端点;oumi launch up 把训练任务提交到云平台;oumi-mcp 提供 MCP 服务器供 Claude、Cursor 等客户端调用。oumi analyze 用于分析,/configs/recipes 则收录了 Qwen、Gemma、Llama、DeepSeek、GLM、Phi、OLMo、gpt-oss、Falcon 等模型的现成配置。
- 团队要为自己的业务场景微调一个 Qwen3 或 Gemma 系列模型,希望直接用现成 YAML 配方跑 LoRA/QLoRA,而不是重写训练脚本。
- 研究者要在多台 GPU 或云集群上做可复现的强化学习实验(GRPO),并需要 FSDP/DeepSpeed 这样的分布式支持。
- 开发者要训练一个会调用工具的 Agent 模型,需要构造数据库、HTTP 或查表类工具环境,并在其上做强化学习。
- 数据团队要用 LLM-as-a-Judge 或 RubricJudge 批量合成、筛选和清洗训练数据,包括视觉语言模型的数据整理。
- 工程团队要在本地或云上部署微调后的模型,通过 vLLM/SGLang 推理,或用 oumi deploy 发布到托管端点。
- 已经用 IDE 里的 AI 助手(如 Claude、Cursor)工作的开发者,想通过 oumi-mcp 这个 MCP 服务器直接驱动 Oumi 的任务流。
如何安装或部署这个 Agent?
README 推荐用 pip(uv)安装:
# 基础安装
uv pip install oumi
# 带 GPU 支持
uv pip install 'oumi[gpu]'
# 最新开发版
uv pip install git+https://github.com/oumi-ai/oumi.git也提供 Docker 镜像与实验性的一键脚本:
docker pull ghcr.io/oumi-ai/oumi:latest
docker run --gpus all -it ghcr.io/oumi-ai/oumi:latest oumi --helpcurl -LsSf https://oumi.ai/install.sh | bash项目处于 beta 阶段,核心功能稳定,但部分高级功能可能变化;更完整的安装选项见官方安装文档。
如何使用这个 Agent?
基本流程是选一份 configs/recipes 下的 YAML 配置,用 oumi CLI 执行:
# 训练
oumi train -c configs/recipes/smollm/sft/135m/quickstart_train.yaml
# 评测
oumi evaluate -c configs/recipes/smollm/evaluation/135m/quickstart_eval.yaml
# 交互式推理
oumi infer -c configs/recipes/smollm/inference/135m_infer.yaml --interactive把任务提交到云端时使用 oumi launch(示例);也可以把当前目录挂载进 Docker 后以 --config 方式训练:
oumi launch up -c configs/recipes/smollm/sft/135m/quickstart_gcp_job.yaml --resources.cloud awsdocker run --gpus all -v $(pwd):/workspace -it ghcr.io/oumi-ai/oumi:latest \
oumi train --config /workspace/my_config.yaml这个 Agent 有哪些优点和局限?
- 覆盖训练、评测、推理、合成数据、部署的完整流水线,一个 oumi CLI 加 YAML 配方即可上手,不必自写训练循环。
- 训练方法齐全:SFT、LoRA、QLoRA、DPO、GRPO,并原生支持 FSDP、DeepSpeed、DDP 等分布式方案。
- 支持在可执行工具环境(数据库、HTTP 端点、查表、模拟)上用 verl 做 GRPO 强化学习,面向工具调用型 Agent 模型。
- 内置多准则 RubricJudge 与 LLM-as-a-Judge,兼顾标准基准测试与自定义评判。
- 部署路径多样:vLLM/SGLang 本地推理、oumi deploy 发布专用端点、oumi-mcp 接入 Claude 与 Cursor,并可提交到 AWS/Azure/GCP/Lambda/Modal/Slurm。
- Apache-2.0 许可,100% 开源,无厂商锁定。
- 项目仍处于 beta,README 明确指出部分高级功能可能随版本变化,生产采用需评估版本稳定性。
- 完整能力依赖 GPU 与较大的 Python/PyTorch 环境,属于重型依赖,入门成本明显高于轻量工具。
- 云端提交与专用端点部署依赖外部平台(AWS、Azure、GCP、Lambda、Modal、Slurm、Fireworks、Parasail 等)的账号与额度。
- 模型覆盖虽广,但多数权重使用自定义许可(如 Llama、Gemma、Qwen),商用时需要逐个核对许可条款。
- README 中大量更新条目日期在 2026 年,与实际发布节奏存在偏差,需要以 release 页面为准核实。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | 形态 / 费用 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|---|
| Oumi 端到端基础模型平台 当前 | 58 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 9.4k | 今天 | Python | Claude Code · OpenAI API |
| AI Agents 项目与教程集合 | 9 · 缺口较多 | 代码库 / SDK免费 + 模型费 | ★ 2.9k | 2 天前 | Jupyter Notebook | OpenAI API · Claude API |
| MARTI:多智能体强化学习训练与推理框架 | 36 · 缺口较多 | 命令行工具免费 | ★ 560 | 1 个月前 | Python | — |
| AgentsMeetRL——智能体强化学习资源大全 | 29 · 缺口较多 | Agent 插件 / 技能免费 | ★ 1.9k | 16 天前 | HTML | — |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据仅来自 README、LICENSE、SECURITY.md、pyproject.toml 与少量 CI/测试文件。least_privilege:README 展示 `oumi launch up` 可创建云资源、`oumi deploy` 可部署端点,但未说明所需最小权限或 IAM 范围,仅得 1。user_confirmation:CLI 训练/部署/云启动均无确认或 dry-run 说明,得 1。data_flow_transparency:README 提到 posthog 遥测依赖与 DO_NOT_TRACK 环境变量(测试中设置),但未在 README 说明数据流向,得 1。sensitive_data_handling:无任何密钥、凭据、PII 处理说明,得 1。dependency_security:pyproject 对多数依赖给出上下界并附注释解释 pin 原因,且存在 CodeQL 工作流,属中等水平,得 2。external_effects:训练/部署/云资源创建等外部副作用未描述回滚或影响范围,得 1。rollback:无回滚或恢复流程说明,得 1。source_attribution:LICENSE 为完整 Apache-2.0 并含版权归属,SECURITY.md 说明漏洞披露渠道,得 2。
self_consistency:README 的安装、CLI、recipes 路径与 pyproject 的入口点(oumi、oumi-mcp)一致,但 README 被截断,无法核对全部链接,得 2。dependency_availability:依赖均来自 PyPI 且带版本区间,注释解释了 omegaconf dev 版本与 lm_eval 上限的原因,得 2。failure_messages:README 提到 partial-failure 支持,但无错误信息或诊断示例,得 1。
audience_and_scenarios:README 明确面向研究者、企业、笔记本到集群到云的多场景,得 3。capability_boundaries:列出支持模型与训练方法,但未系统说明不支持的能力或边界,得 2。trigger_precision:作为框架/CLI,无触发条件或调用时机说明,得 1。environment_fit:覆盖 pip、Docker、安装脚本、多 Python 版本、多 GPU/云平台,得 3。
information_architecture:README 结构清晰(News/About/Getting Started/Usage/Examples),但文件被截断,得 2。install_notes:pip、uv、Docker、实验性安装脚本及 GPU 变体说明充分,得 3。naming_stability:CLI 命令与配置路径命名一致,但无稳定性承诺,得 2。examples_and_faq:大量 Colab notebook 与 recipes 表格,得 3。known_limitations:仅一句 beta 提示,无系统限制说明,得 1。license:完整 Apache-2.0 文本,得 3。versioning_changelog:News 段落列出多个版本发布与链接,得 3。maintenance_responsibility:SECURITY.md 说明团队响应流程,但发布者身份未验证,得 2。
output_usability:CLI 与 recipes 可直接产出训练/评估/推理结果,但无输出格式说明,得 2。marginal_value:整合训练、评估、部署、数据合成,相对零散工具链有增量价值,得 2。cost_benefit:依赖极重(torch、vllm、verl、deepspeed 等),资源与安装成本高,README 未讨论成本权衡,得 1。
claim_traceability:README 声称 SOTA、企业级、生产级可靠性,但未提供基准或证据链接,得 1。cross_source_corroboration:README 与 pyproject 在依赖和入口点上可互相印证,但安全与可靠性声明无第二来源,得 1。fact_inference_separation:README 将营销性表述与事实混排,未区分声明与证据,得 1。
- README 声称“生产级可靠性”“企业级”,但未提供基准、测试报告或可核验证据,应视为营销表述。
- 云资源创建(oumi launch up)与端点部署(oumi deploy)缺少最小权限、确认步骤与回滚说明,实际使用前需自行评估权限与成本。
- 依赖集极重(torch、vllm、verl、deepspeed 等),安装与运行成本高,且部分依赖使用 dev 版本或严格上限,可能引发冲突。
- 发布者身份未经验证,维护责任与更新路径仅能依据仓库内 SECURITY.md 与发布记录推断。
- README 文件在证据中被截断,部分链接与声明无法完整核对。