MLE-Agent
面向机器学习工程与研究的命令行助手,可搭建基线、检索论文并协助完成本地开发流程。
- Star 数
- ★ 1.6k
- 最近更新
- 2 个月前
- License
- MIT
- 主语言
- Python
- FA 评分
- 41/100 · 缺口较多
30 秒速览
- 运行形态
- 可在哪里用
- 兼容但需适配OpenAI API · Claude API(部分支持)
- 费用
- 软件免费,模型调用费用自付
- 上手难度
- 低 · 几分钟可跑通
- 开始前需要
- 典型场景
- 机器学习工程师需要把一段模糊需求,例如基于历史数据预测股价,快速转化为可在本机测试的 ML 基线时。
- 不适合
- 希望用图形界面而非终端完成 ML 工作流的用户
- 需要 Hugging Face、S3、MLflow、W&B 等集成开箱即用的团队
这个 Agent 能做什么,适合哪些场景?
MLE-Agent 是面向机器学习工程师和研究人员的配对式 LLM Agent。它通过 `mle` 命令行创建和启动项目,并提供终端交互聊天。项目描述其能力包括自动构建 ML/AI 基线、在本地机器或云端执行与调试代码,以及使用 Arxiv、Papers with Code 和关键词搜索获取参考方法。它还提供 Kaggle 工作流、周报生成和本地 RAG 支持;README 同时列出 OpenAI GPTs、Anthropic Claude 3.5 Sonnet 与 Ollama Llama3 支持。适合希望在本地项目目录中把需求梳理、研究检索、代码执行和结果总结串联起来的 ML 工作流,但具体模型凭据与配置方式未在给定材料中说明。
使用 mle new <project name> 创建项目目录后,可在目录中运行 mle start 开始 ML/AI 项目工作流,或运行 mle chat 进行终端交互。该项目声称会根据需求构建 ML/AI 基线,检索 Arxiv、Papers with Code 和通用关键词搜索结果以参考方法,并在本地机器或云端执行、调试和修复代码。mle kaggle 用于启动 Kaggle 任务;mle kaggle --auto 可接收数据集路径、描述、提交文件、提交样例和竞赛 ID,以执行从数据准备到模型训练和调试的自动化流程。mle report 在本地 http://localhost:3000/ 提供从 GitHub 生成报告的网页入口,mle report-local --email=<git email> --start-date=YYYY-MM-DD --end-date=YYYY-MM-DD <path_to_git_repo> 则从本地 Git 仓库生成报告。
- 机器学习工程师需要把一段模糊需求,例如基于历史数据预测股价,快速转化为可在本机测试的 ML 基线时。
- 参赛者已加入 Kaggle 竞赛,并准备好数据集与提交文件,希望通过
mle kaggle --auto推进数据准备、训练和调试时。 - 研究人员在规划模型方案时,需要结合 Arxiv、Papers with Code 与关键词搜索查找方法参考时。
- 开发者希望在项目目录内使用
mle chat,以交互方式改进已有 ML 项目时。 - 需要根据 GitHub 工作或本地 Git 仓库提交整理开发进展、沟通记录、参考资料和待办事项的团队成员时。
如何安装或部署这个 Agent?
通过 PyPI 安装:
pip install -U mle-agent或使用 uv:
uv pip install -U mle-agent从源码安装:
git clone https://github.com/MLSysOps/MLE-agent.git
cd MLE-agent
uv venv .venv
source .venv/bin/activate
pip install -e .给定材料列出了 OpenAI、Anthropic 和 Ollama 等模型支持,但没有说明所需凭据、环境变量或模型配置步骤。
如何使用这个 Agent?
创建并启动项目:
mle new <project name>
cd <project name>
mle start在同一项目目录中启动终端聊天:
mle chat启动 Kaggle 工作流:
mle kaggle生成本地 Git 周报:
mle report-local --email=<git email> --start-date=YYYY-MM-DD --end-date=YYYY-MM-DD <path_to_git_repo>这个 Agent 有哪些优点和局限?
- 将 ML 基线构建、代码执行与调试、研究检索和项目建议组合在同一套项目级 CLI 工作流中。
- 明确集成 Arxiv、Papers with Code 和通用关键词搜索,适合需要将研究参考带入方案规划的场景。
- 提供
mle kaggle --auto参数化流程,可接收数据集、竞赛描述和提交文件等实际竞赛输入。 - 同时提供终端聊天、GitHub 报告网页入口和本地 Git 报告命令,不只覆盖代码生成环节。
- README 列出 OpenAI GPTs、Anthropic Claude 3.5 Sonnet 与 Ollama Llama3,具有多模型接入方向。
- 给定材料没有说明模型供应商凭据、环境变量、配置文件或默认模型,因此首次可用配置仍需自行确认。
- Kaggle 自动模式要求用户已加入竞赛,并自行准备数据集、提交文件和提交样例。
- 代码执行涉及本地文件系统和本地机器或云端执行,采用前需要评估代码与数据的执行边界。
- 云端数据、测试调试平台、Hugging Face、AWS S3、MLflow、Wandb 等多项集成在路线图中仍标为未完成。
- README 宣称可进行端到端竞赛任务,但给定材料未提供成功率、评测结果或资源消耗数据。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | 形态 / 费用 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|---|
| MLE-Agent 当前 | 41 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 1.6k | 2 个月前 | Python | — |
| optim-agent | 65 · 存在缺口 | 代码库 / SDK免费 + 模型费 | ★ 939 | 1 个月前 | Python | Codex · Claude Code |
| Metaflow | 77 · 表现良好 | 代码库 / SDK免费 | ★ 10k | 12 天前 | Python | — |
| Karpathy 代理机器学习工程师 | 37 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 1.6k | 1 个月前 | Python | Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:项目使用API密钥(如LITELLM_API_KEY)和环境变量,但未明确最小权限原则;有交互式CLI和用户确认机制(如mle start),但未详细说明;数据流透明度有限,未说明数据如何被处理或存储;敏感数据处理未明确;依赖项众多,但未提供安全审计;外部效果(如执行代码、访问网络)存在,但未明确限制;未提供回滚机制;来源归属部分,有作者信息但未验证。扣分原因:缺乏具体的安全措施和透明度。
证据显示:项目有测试(如test_litellm_model.py),但测试覆盖有限;依赖项众多,但未提供可用性保证;错误消息部分,如测试中处理了认证错误等,但未全面。扣分原因:测试覆盖不足,依赖可用性未验证。
证据显示:面向ML工程师和研究人员,场景明确(如Kaggle、报告生成);能力边界部分,有功能列表但未明确限制;触发精度一般,有CLI命令但未详细说明;环境适配部分,支持多种模型和操作系统,但未详细说明。扣分原因:能力边界和触发精度不够明确。
证据显示:信息架构清晰,有README、文档链接;安装说明详细;命名稳定,有CLI命令;有示例和FAQ;已知限制部分,有roadmap但未明确;许可证为MIT,但pyproject.toml中写的是Apache-2.0,不一致;版本变更日志部分,有milestones但未提供详细changelog;维护责任部分,有作者信息但未明确。扣分原因:许可证不一致,版本变更日志不详细。
证据显示:输出可用性高,有CLI和Web UI;边际价值高,提供自动化ML任务;成本效益部分,未提供成本信息。扣分原因:成本效益未评估。
证据显示:声明可追溯性部分,有文档和测试;跨来源佐证部分,有测试和CI;事实与推断分离部分,未明确。扣分原因:缺乏事实与推断的明确分离。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 许可证不一致:README和LICENSE为MIT,但pyproject.toml声明Apache-2.0,需澄清。
- 依赖项众多且未提供安全审计,建议检查依赖安全性。
- 数据流和敏感数据处理不透明,使用前需评估隐私风险。
常见问题
需要哪些模型供应商凭据?
它会访问或执行本地内容吗?
能否完全自动参加 Kaggle?
mle kaggle --auto,但要求你已加入竞赛,并准备好数据集、描述、提交文件、提交样例和竞赛 ID。