开发与工程 pythonevolutionary-algorithmscode-generationprogram-evaluationlitellmdocker-sandboxinggradio

OpenAlpha Evolve

用 LLM 驱动的进化循环生成、测试并改进 Python 算法。

FollowAgents 评估 · FARS-2.0
待评估
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

OpenAlpha Evolve 是一个用于自动发现和迭代改进 Python 算法的开源框架,灵感来自 DeepMind 的 AlphaEvolve 研究。它由 PromptDesignerAgent、CodeGeneratorAgent、EvaluatorAgent、DatabaseAgent、SelectionControllerAgent 和 TaskManagerAgent 组成。用户通过 YAML 任务文件或 TaskDefinition 描述待实现函数、允许导入项和测试用例,系统随后生成候选程序并按代际演化。生成的程序会接受 Python 语法检查,并在 Docker 容器中针对任务测试执行和评分。项目可通过命令行运行示例任务,也提供 Gradio Web 界面用于交互式定义任务和启动演化。

用户先定义包含 task_id、task_description、function_name、allowed_imports 与 tests 的 YAML 任务。PromptDesignerAgent 生成初始、变异和修复提示;CodeGeneratorAgent 通过 LiteLLM 调用模型生成 Python 代码,并在收到 diff 时尝试将改动应用到父代代码。EvaluatorAgent 检查语法,在临时隔离环境中运行代码,并依据测试通过情况、运行时间及潜在指标计算 fitness。DatabaseAgent 保存代码、fitness、代数和谱系;SelectionControllerAgent 选择父代与幸存者;TaskManagerAgent 重复这一流程直至达到设定代数。输出包括进化得到的候选 Python 程序、评估结果和日志,默认日志文件为 alpha_evolve.log。

  1. 算法研究人员希望在明确的输入输出测试下,探索 Dijkstra 等算法问题的候选实现。
  2. Python 开发者需要用 YAML 描述函数签名、允许导入项和边界测试,并让系统迭代生成实现。
  3. 实验者想比较 LLM 生成程序在变异、diff 修复和选择后的适应度变化。
  4. 需要在 Docker 隔离执行环境中,对生成 Python 代码进行语法检查和功能测试的原型团队。
  5. 希望通过 Gradio 页面交互式提交自定义任务并观察演化过程的开发者。

这个 Agent 有哪些优点和局限?

优点
  • 将提示设计、代码生成、评估、存储、选择和编排拆分为独立 Agent,便于替换或扩展其中的策略。
  • 支持初始生成、diff 变异和 diff 修复,使后续候选程序能基于父代代码进行定向改动。
  • 评估流程同时包含语法检查、测试用例执行和 fitness 评分,而非只生成代码文本。
  • 通过 LiteLLM 说明了 OpenAI、Anthropic、Google 等多个模型提供商路径,避免只绑定单一模型接口。
局限
  • 运行生成代码依赖本地 Docker,并要求 Docker Desktop 或 Docker Engine 已安装且正在运行。
  • 实际生成需要配置模型提供商凭据;API 使用及其费用由所选提供商决定。
  • README 明确声明项目为实验性项目,生成代码可能不最优、不正确或不安全,生产使用前必须人工审查和测试。
  • DatabaseAgent 目前使用内存存储,来源未说明持久化数据库、恢复机制或多用户部署方案。
  • 配置说明中的 .env.example 与复制命令中的 .env_example 命名不一致,安装时需要核对仓库中的实际文件名。

如何安装或部署这个 Agent?

前置条件为 Python 3.10+、pip、Git 和正在运行的 Docker。执行:

git clone https://github.com/shyamsaktawat/OpenAlpha_Evolve.git
cd OpenAlpha_Evolve
python -m venv venv
source venv/bin/activate
pip install -r requirements.txt
cp .env_example .env

然后在 .env 中配置所选模型提供商的凭据:Google 可使用 GOOGLE_APPLICATION_CREDENTIALS 或 GEMINI_API_KEY;示例中也列出 OPENAI_API_KEY、ANTHROPIC_API_KEY 和 COHERE_API_KEY。项目通过 LiteLLM 对接不同提供商。

如何使用这个 Agent?

使用示例最短路径任务运行:

python -m main examples/shortest_path.yaml

系统会执行演化循环,并将日志写入终端及默认的 alpha_evolve.log。若要使用网页界面,运行:

python app.py

然后打开 Gradio 显示的本地 URL,在界面中定义任务并启动演化。

这个 Agent 与同类方案有什么区别?

该项目明确说明其灵感来自 DeepMind 的 AlphaEvolve,并定位为对核心理念的开源再实现,用于更广泛的实验和学习。来源没有提供与 AlphaEvolve 的功能对等性、性能或部署方式比较。

常见问题

能否选择不同的模型提供商?
可以。项目通过 LiteLLM 接入多个提供商,文档列举了 Google、OpenAI、Anthropic 和 Cohere 的环境变量示例;需要为实际选择的提供商配置对应凭据。
生成的代码是否可以直接用于生产?
不应直接视为生产就绪。项目声明生成代码可能不最优、不正确或不安全,尤其在生产使用前应进行人工审查和充分测试。
为什么需要 Docker?
Docker 用于在隔离环境中执行生成的代码并管理依赖;评估还具有可配置的超时机制。
如何定义要演化的问题?
推荐在 examples 目录中创建 YAML 文件,提供任务描述、目标函数名、允许导入项及测试组;也可通过 TaskDefinition 在 Python 中以旧方式定义任务。
会保存演化历史吗?
DatabaseAgent 会保存程序代码、fitness、代数和谱系,但文档说明当前存储是内存中的,未提供持久化配置说明。

相关 Agents