开发与工程 skill-acquisitionskill-engineeringagent-skillsopen-world-sourcescodexskills-bencharxiv

SkillAlchemy

开放世界智能体技能创造系统:把模糊的技能简报与公开资料,转化为可直接安装、可复用的智能体技能包。

FollowAgents 评估 · FARS-2.1
不推荐
36/ 100 五分制 1.8 / 5
1 2 3 4 5 6
1信任安全10 / 29 · 1.7/5

证据仅含 README、LICENSE 与 package.。可见面:系统会抓取开放世界来源并写入 output/ 目录,权限与网络行为无任何说明(least_privilege=1);生成/安装过程未见用户确认或审阅机制(user_confirmation=1);数据流向(抓取哪些源、上传什么)完全未披露(data_flow_transparency=1);"Distill people"从公开信息构建人物 Persona,涉及第三方个人信息,但无任何隐私处理政策(sensitive_data_handling=1);仅提供 npx 安装方式,无依赖清单、锁文件或安全审计说明(dependency_security=1);有文件写入与网络访问等外部效应但无边界声明(external_effects=1);完全未提及卸载、回滚或恢复手段(rollback=0);论文、作者、arXiv 链接齐全,出处标注较好,但出版方未经注册表验证,故 source_attribution=2。

2可靠稳定3 / 14 · 1.1/5

README 与 package. 之间名称、定位大体一致,但内容极薄,无内部文件可交叉印证(self_consistency=1);依赖 npx skills 与目标 Agent 环境,无任何可用性保障或版本要求说明(dependency_availability=1);通篇无错误处理、失败消息或降级行为的描述(failure_messages=0)。

3适用触发9 / 18 · 2.5/5

Features 清楚列出适用场景(RAG 评审、方法论提炼、人物技能等),受众明确(audience_and_scenarios=2);但技能产物可靠性的边界仅有一句"证据范围判定",无约束说明(capability_boundaries=1);触发方式仅为自然语言描述,无精确触发条件或防误触机制(trigger_precision=1);明确支持 Claude Code 与 Codex 并给出安装命令,环境适配说明尚可(environment_fit=2)。

4规范维护8 / 18 · 2.2/5

README 结构清晰但 TECHNICAL.md、skills/ 目录内容均未在证据中呈现,信息架构可确认度低(information_architecture=1);三种安装方式(Agent 指令、npx、单技能安装)描述清楚(install_notes=2);SkillAlchemy 命名在 README 与 package. 一致(naming_stability=2);仅有用法示例、无 FAQ(examples_and_faq=1);完全没有已知限制、失败案例或适用边界声明(known_limitations=0);MIT License 文件完整且与元数据一致(license=3);package. 标 v1.0 但无 CHANGELOG 或版本历史(versioning_changelog=1);无维护者、更新策略或支持渠道说明,出版方身份未经验证(maintenance_responsibility=0)。

5有效结果4 / 13 · 1.5/5

产物写入 output/ 的路径明确,但产物格式、结构、质量标准未在可见文件中定义(output_usability=1);宣称的 55.8% 通过率等收益数据无法在仓库内验证,边际价值仅是断言(marginal_value=1);成本(Token、网络抓取量)与收益权衡完全未讨论(cost_benefit=1)。

6证据核验2 / 8 · 1.3/5

性能声明指向 arXiv 论文,但注意:编号 2608.23417 与"2026 年"日期、以及 DeepSeek-V4-Pro、Opus 4.8、GPT-5.5 等模型名在本次静态审查时点上均无法核实,属于不可追溯的声明(claim_traceability=1);仓库内无任何第二来源可佐证基准结果(cross_source_corroboration=0);README 将实验结果与产品描述混排,未标注证据等级(fact_inference_separation=1)。

证据充分度: 评估于 2026年9月10日 审查版本 6ea799f6deb1
源码中未见的安全控制:回滚或恢复路径
使用前请注意
  • README 中的基准数据(55.8% 通过率等)与 arXiv 编号、模型名称在本次静态审查中均无法核实,请勿视为已证事实。
  • 系统具有开放网络抓取与本地文件写入能力,但无权限边界、确认机制或回滚说明;建议在隔离环境中先行试用。
  • Distill people
  • 会基于真人公开信息生成 Persona 技能,存在隐私与名誉风险,且仓库无任何隐私处理政策。
  • 出版方身份未经注册表验证,仓库缺少维护者与更新承诺信息,长期可用性未知。
  • 无已知限制、无 CHANGELOG、无失败处理文档,生产环境采用前需自行审计实际生成的技能内容。
评估证据 [1][2][3]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

SkillAlchemy 是一个开源的开放世界智能体技能创造系统,出自论文《SkillAlchemy: Open-World Agent Skill Creation》。它面向陌生领域的任务:原始技能简报往往省略关键需求,专家流程可能不存在,执行轨迹也难以获取。为此,它把技能创造建模为「基于来源的流程准入」问题:先从简报中挖掘被省略的隐含需求,再从文档、代码仓库、论文、issue 等公开来源获取有据可依的流程,并判定每条流程的证据支撑范围(可复用指令、限定范围的示例,或予以排除)。最终它将准入的知识编译为智能体可直接加载安装的 Skill 包,输出写入当前项目的 output/ 目录。它兼容 Claude Code 和 Codex 两种智能体,并附带 Lens、LEAP 等可单独安装的技能。在 SkillsBench v1.1 的 87 个任务上,四种智能体-模型配置平均任务通过率达 55.8%,略超人工精选技能。项目采用 MIT 许可证发布。

SkillAlchemy 的端到端流程是:读取一个欠规范的技能简报(例如「创建一个审查 RAG 系统的 Skill」),首先发现简报中缺失的隐含需求、约束和运行维度;然后从异构公开来源(文档、仓库、论文、issue 报告等)获取候选流程,评估每条流程的证据支撑广度,决定其是可复用指令、限定范围示例还是应排除;可选能力包括把人物(决策、失败、价值观、沟通风格)提炼为 Persona Skill、把方法论提炼为含条件/步骤/分支/失败处理的技能,以及融合既有工作流为新能力。最终它将准入的流程、示例、引用和支撑资源编译为可安装的 Skill 包写入 output/。技能可通过 npx skills add 安装到 Claude Code 或 Codex 中加载使用。

  1. 需要在陌生技术领域(如 RAG 系统审查)创建智能体技能、但缺乏现成专家流程文档的工程师,希望系统从公开文档和论文中自行补全需求并生成技能
  2. 希望把某位专家的方法论、书籍或访谈内容转化为可执行、可分支、带失败处理的智能体技能的知识工作者
  3. 维护智能体团队的技术负责人,想用融合(Fuse)能力把多个既有工作流或领域知识合并为一个新技能
  4. 研究自动化技能创造的学者,需要在 SkillsBench 上对比自动生成技能与人工精选技能的效果
  5. 使用 Claude Code 或 Codex 的用户,想一键安装 Lens、LEAP 等现成技能来增强自己的智能体

这个 Agent 有哪些优点和局限?

优点
  • 有量化评测支撑:在 SkillsBench v1.1 的 87 个任务上,四种智能体-模型配置平均通过率 55.8%,其中 3/4 配置为最高,比无技能执行高 19.9 个百分点
  • 表现与人工精选技能相当(54.4%)并略有超越,且比最强的自动技能创建基线高 8.6 个百分点
  • 独特的证据准入机制:区分可复用指令与仅限特定上下文的示例,而非把所有检索结果当作普遍有效
  • 同时支持 Claude Code 和 Codex,技能也可单独安装复用,MIT 许可证便于集成
局限
  • 依赖 Claude Code 或 Codex 作为运行时智能体,无法脱离这两类宿主直接运行(其他智能体平台未提及支持)
  • 评测中并非全胜:在 Codex + DeepSeek-V4-Pro 配置下(43.9%)反而低于人工精选技能的 45.7%
  • 安装依赖 npx skills CLI,需要 Node.js 环境;README 未说明离线或受限网络下如何运行,开放世界来源获取依赖网络访问
  • 论文标注为 2026 年 arXiv 预印本(arXiv:2608.23417),尚非经同行评审的成果,技术细节需自行核验

如何安装或部署这个 Agent?

最简单的方式是直接让 Claude Code 或 Codex 安装:「Install SkillAlchemy from https://github.com/agentsope/SkillAlchemy and show me how to use it.」。也可以用命令行安装:npx skills add agentsope/SkillAlchemy。需要 Node.js 环境以运行 npx。也可单独安装组件:npx skills add agentsope/SkillAlchemy/skills/Lens、npx skills add agentsope/SkillAlchemy/skills/LEAP,或任意 skills/<skill-name>。

如何使用这个 Agent?

安装后,用自然语言描述你想创建的技能,并指定来源,例如:「Use SkillAlchemy to create a Skill for reviewing RAG systems. Use public documentation and research papers as sources.」SkillAlchemy 会挖掘隐含需求、从公开来源获取流程、判定证据支撑范围,并将生成的技能包写入当前项目的 output/ 目录;随后智能体可直接加载该技能使用。支持的目标智能体为 Claude Code 和 Codex。

这个 Agent 与同类方案有什么区别?

README 的评测表将其与 Anthropic Skill-Creator、OpenAI Skill-Creator、OpenSkill、MUSE-Autoskill 以及人工精选技能直接对比;平均通过率上 SkillAlchemy(55.8%)超过这些自动基线(最高为 MUSE-Autoskill 的 47.2%),也略超人工精选技能(54.4%),适合需要在陌生领域自动创建技能、而非依赖官方 Skill-Creator 模板的用户。

常见问题

它支持哪些智能体?
官方支持 Claude Code 和 Codex 两种智能体,README 未提及对其他智能体平台的直接支持。
需要付费或调用哪些模型?
README 未说明使用成本。评测涉及 DeepSeek-V4-Pro、Opus 4.8、GPT-5.5 等模型,实际运行成本取决于你所用智能体和模型的计费方式。
生成的技能放在哪里?如何使用?
生成的技能包写入当前项目的 output/ 目录,包含准入的流程、示例、引用和支撑资源,智能体可直接加载安装使用。
效果是否可靠?
在 SkillsBench v1.1 的 87 个任务、四种智能体-模型配置中,平均通过率 55.8%,3/4 配置中排名第一;但在 Codex + DeepSeek-V4-Pro 配置下低于人工精选技能,不同配置下的表现需自行验证。
可以只安装部分组件吗?
可以。除整体安装外,可用 npx skills add 单独安装 Lens、LEAP 等任何 skills/ 目录下的技能。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents