开发与工程 algorithm-designevolutionary-optimizationcode-generationheuristic-searchinteractive-clibenchmark-optimizationmulti-provider

OpenLoopX · LLM4AD Next

从问题描述出发,自动生成并运行进化式算法搜索流程。

FollowAgents 评估 · FARS-2.1
不推荐
58/ 100 五分制 2.9 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全11 / 29 · 1.9/5

证据显示项目通过环境变量或全局设置接收模型凭据,CI 发布任务将权限限制为 contents: read,并完整声明 BSD 许可及 AutoResearchClaw 的第三方来源,因此来源归属充分。扣分在于:未说明生成或演化代码的沙箱、最小文件/网络权限、运行前确认机制、发送给模型供应商的具体数据边界、日志脱敏、密钥存储保护或用户数据保留政策;自动生成并运行代码、扫描仓库及调用外部模型可能产生重要外部效果,但材料没有逐项解释或要求确认。依赖多采用宽泛下限,CI 使用 latest 安装器且 GitHub Actions 未固定到提交哈希,没有依赖审计、锁文件或漏洞响应证据。仅从配置中的 git worktree 类型检查例外可推测存在版本控制设施,尚不足以证明面向用户的回滚流程。

2可靠稳定8 / 14 · 2.9/5

README、包元数据和 CI 对 Python 3.12、CLI 入口、测试目录及主要用途大体一致,CI 覆盖三种操作系统、单元测试和一个端到端基准。扣分是发布材料仍标为 Alpha,README 的方法表存在重复分隔行,并且大量依赖只有最低版本或依赖 latest 安装器,降低环境可重复性与长期可用性保证。错误信息证据主要限于 Docker 发布配置缺失时的明确提示;没有展示 Agent 在模型失败、无效生成代码、超时、配额耗尽或评估器异常时的用户级诊断与恢复提示。

3适用触发14 / 18 · 3.9/5

目标受众和场景描述清楚,覆盖开发者、科研人员、交互式项目生成、既有配置运行、仓库代码块分析、多种搜索方法和多个应用案例,可获高分。能力边界通过 Available/Pending 表格和 Alpha 状态得到部分说明,但生成代码的安全边界、支持问题类型、规模限制以及质量保证边界不完整。触发方式有明确的 llm4ad chat、llm4ad run 和 evolution.type 配置,但未给出何时允许 Agent 写文件或执行生成代码的精细触发规则。环境方面声明 Python 3.12+、uv/pip、可选依赖及三平台 CI,但系统资源、容器运行约束、GPU/编译器需求和各可选场景的兼容矩阵不完整。

4规范维护14 / 18 · 3.9/5

README 提供快速开始、文档索引、项目结构、配置、贡献、支持和许可,信息架构与安装说明较完整。BSD-3-Clause 文本、版权主体和免责声明齐全,许可得满分。扣分在于仓库/品牌/包名同时出现 OpenLoopX、LLM4AD Next、LLM4AD_Next 和 LLM4AD,命名并非完全稳定;示例丰富但所给材料没有 FAQ;Pending 方法及 Alpha 分类揭示了一些限制,却没有集中的已知问题清单。版本 1.1.0、新闻和 Releases 链接形成基本更新路径,但未提供随附的逐版本变更正文。维护入口有 contributors、贡献指南、讨论区和 issue tracker,但维护者仅标为笼统的 LLM4AD Contributors,未明确个人、团队职责或响应承诺;发布者身份未知本身未被当作负面证据。

5有效结果7 / 13 · 2.7/5

材料显示可生成 evaluator、算法骨架、配置和 debugger,并提供可直接运行的 CLI、示例配置、数学基准结果以及代码、经验和 result.json 工件,因此输出具有较好的后续可用性,也相较传统多步配置展示了合理的增量价值。扣分是这些效果仅由仓库静态材料主张,未在本评审中执行验证;部分搜索方法仍待实现,且没有系统比较人工基线、失败率或不同任务上的收益。在线演示称无需 API key,本地方案却依赖外部 LLM 和较重的科学计算栈;未说明令牌预算、预计运行时、算力、存储或成本控制,因此成本收益只得到有限支持。

6证据核验4 / 8 · 2.5/5

主要功能主张可映射到命令、配置键、项目结构和工件路径,基准表还列出具体数值及结果文件;README 的 Python、版本、许可证、CLI 和测试叙述也受到 pyproject、LICENSE 与 CI 配置的交叉支持。扣分是未提供基准生成方法、独立复核记录或此处可见的测试实现与覆盖率阈值,外部对比结果也仅在 README 中陈述。营销性措辞如“instantly understand”“entire runnable app framework”和“destroys this entry barrier”没有与可验证事实清楚分层,实测事实、推断和宣传之间的区分不足。

证据充分度: 评估于 2026年9月17日 审查版本 1b7fffb3d3ab
源码中未见的安全控制:执行前用户确认
使用前请注意
  • 该平台会生成并可能执行代码;在处理不可信任务或仓库前,应使用隔离环境并人工审查生成内容,因为所给材料未证明默认沙箱、权限边界或执行前确认。
  • API 密钥和任务内容可能交由外部模型服务处理;在明确供应商数据流、日志脱敏、保留政策和密钥保护方式前,不应提交敏感代码或数据。
  • 依赖范围较宽,CI 还使用 latest 工具版本;部署时应采用审查过的锁定依赖与固定构建链,并进行漏洞扫描。
  • README 中的基准结果和效率宣传未经本次静态评审执行或独立复核,不应直接视为性能保证。
  • Docker Hub 工作流会在 main 分支每次推送时发布 latest 镜像;维护者应确保分支保护、凭据范围和发布审批符合组织要求。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

LLM4AD Next 是一个结合大语言模型代码设计与进化优化的自动算法设计平台。其交互式终端 `llm4ad chat` 会访谈用户需求,并生成可运行项目所需的 evaluator、算法骨架、配置和 debugger。生成的项目由 planner、coder、evaluator 与 orchestrator 等组件协同执行,通过多轮搜索演化候选代码。平台还提供 Evolve-Block Advisor 与 Recommender,用于扫描代码仓库、评估代码块并推荐适合优化的目标。用户既可通过免安装的在线演示使用完整工作流,也可在 Python 3.12+ 环境中本地运行 CLI,并通过全局设置接入 OpenAI 或 Anthropic 提供商。

用户可以运行 llm4ad chat,通过对话描述待解决的问题;内置 consultant 随后生成 evaluator、算法骨架、配置文件和 debugger,形成可执行的搜索项目。对于已有项目,llm4ad run <config.yaml> 会读取任务配置,并由 planner、coder、evaluator 和 orchestrator 驱动候选算法的生成、评估与进化。配置中的 evolution.type 可选择 diverse_island_gaisland_gaeohmeohreevomcts_ahddyca 等已实现搜索方法。Evolve-Block Advisor 与 Recommender 可以扫描目标仓库,对代码块评分,并推荐最值得演化的部分。平台还包含按全局、项目和任务划分的长期记忆能力,以及带有独立 evaluator、演化实现和经验产物的 AlphaEvolve Mathematics Benchmark 案例。

  1. 算法工程师只有自然语言问题描述,希望快速生成 evaluator、初始算法骨架和可运行搜索配置。
  2. 研究人员需要在同一框架中试验 EoH、MEoH、ReEvo、MCTS-AHD、IslandGA 或 DyCA 等自动启发式设计方法。
  3. 维护现有代码库的开发者希望先扫描和评分代码块,再选择最有潜力的局部进行进化优化。
  4. 数学优化研究者希望复现或扩展圆形包装、自相关不等式、Heilbronn 三角形等基准案例。
  5. 团队需要在 OpenAI 与 Anthropic 模型配置之间切换,并通过共享的全局 provider 设置管理凭据和模型。
  6. 希望低门槛试用自动算法设计的用户,可以先使用无需本地安装和 API key 的在线演示。

这个 Agent 有哪些优点和局限?

优点
  • llm4ad chat 将需求访谈、evaluator、算法骨架、配置和 debugger 的生成整合为一个交互式流程。
  • 已提供 IslandGA、Diverse Island GA、MEoH、DyCA、EoH、ReEvo 和 MCTS-AHD 的可用 orchestrator,而不是只列出算法概念。
  • Evolve-Block Advisor 与 Recommender 能面向现有代码仓库定位并评分候选优化代码块。
  • 同时提供在线演示、本地 CLI、文档与 Python API 路径,且全局设置明确展示 OpenAI 和 Anthropic provider 配置。
  • AlphaEvolve Mathematics Benchmark 包含多个独立运行的数学优化案例、案例级 evaluator、演化实现和经验产物。
局限
  • 本地安装要求 Python 3.12+,可能高于部分团队现有运行环境的版本。
  • 本地 LLM 工作流依赖外部模型提供商、网络连接及相应 API 凭据;相关调用成本取决于所选服务。
  • FunSearch、HillClimb、LHNS、LLaMEA、MLES、MOEA/D、NSGA-II、PartEvo 和 RandSample 在所列搜索方法表中仍没有可用 orchestrator。
  • 部分方法虽然提供 Algorithm Design Skill,但技能可用并不等于平台内已有对应搜索实现。
  • 仓库展示了精选数学基准结果,但没有提供足以证明其适合所有业务领域或任意代码库的通用性能证据。

如何安装或部署这个 Agent?

本地运行要求 Python 3.12+,并推荐使用 uv,也支持 pip。可按以下步骤安装:

git clone https://github.com/Optima-CityU/LLM4AD_Next.git
cd LLM4AD_Next
uv sync

然后配置模型提供商,例如:

export LLM_BASE_URL="https://api.openai.com/v1"
export LLM_API_KEY="your-api-key"
export LLM_MODEL="gpt-4o"

首次运行可执行 llm4ad chat。开发环境可使用 uv sync --extra all 安装完整可选依赖。若不希望安装,可直接访问 https://llm4ad-next.cn/;该在线演示不要求 API key。

如何使用这个 Agent?

新项目推荐在目标目录中运行 llm4ad chat,回答交互式 consultant 的问题,让它创建完整的可运行项目。已有配置时,可直接执行 llm4ad run examples/applications/tsp_benchmark_python/config.yaml。选择搜索方法时,在 YAML 中设置 evolution.type,例如:

evolution:
  type: "eoh"

跨项目共享 provider 时,在 ~/.llm4ad/settings.yaml 中配置 providers。OpenAI 配置可使用 type: openai${OPENAI_API_KEY} 和模型名;Anthropic 配置可使用 type: anthropic${ANTHROPIC_API_KEY} 和模型名。任务配置之后只需引用 provider 名称。

这个 Agent 与同类方案有什么区别?

相较原始 LLM4AD 所代表的多步骤配置流程,LLM4AD Next 的核心差异是通过 llm4ad chat 自动生成 evaluator、算法骨架、配置和 debugger。仓库还在 AlphaEvolve Mathematics Benchmark 中列出与 AlphaEvolve、LoongFlow 的逐案例数值比较;结果并非每项都占优,例如 First autocorrelation inequality、Minimum overlap 和 Heilbronn triangle 的表列数值未超过所有已发布对照结果,因此应按具体优化目标评估。

常见问题

试用时必须提供模型 API key 吗?
在线演示明确标注无需安装或 API key。本地工作流则需要配置模型提供商;示例使用 OpenAI 或 Anthropic 的 API key。
它会直接修改现有仓库中的任意代码吗?
已明确记录的 Advisor/Recommender 能扫描、评分并推荐适合演化的代码块;来源没有说明它会在未经用户配置的情况下自动修改任意仓库。
所有列出的搜索算法都能直接运行吗?
不能。当前标为已有实现的是 IslandGA、Diverse Island GA、MEoH、DyCA、EoH、ReEvo 和 MCTS-AHD;其他多种方法仍标为 Pending。
如何在多个项目间复用模型配置?
可在 ~/.llm4ad/settings.yaml 中定义具名 providers,任务配置只引用 provider 名称,由全局设置解析凭据与模型。
许可证允许什么?
仓库声明采用 BSD 3-Clause License。AutoResearch 模块基于或改编自 MIT 许可的 AutoResearchClaw,其原始声明保留在 THIRD_PARTY_LICENSES.md

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents