SkillAlchemy
开放世界智能体技能创造系统:把模糊的技能简报与公开资料,转化为可直接安装、可复用的智能体技能包。
证据仅含 README、LICENSE 与 package.。可见面:系统会抓取开放世界来源并写入 output/ 目录,权限与网络行为无任何说明(least_privilege=1);生成/安装过程未见用户确认或审阅机制(user_confirmation=1);数据流向(抓取哪些源、上传什么)完全未披露(data_flow_transparency=1);"Distill people"从公开信息构建人物 Persona,涉及第三方个人信息,但无任何隐私处理政策(sensitive_data_handling=1);仅提供 npx 安装方式,无依赖清单、锁文件或安全审计说明(dependency_security=1);有文件写入与网络访问等外部效应但无边界声明(external_effects=1);完全未提及卸载、回滚或恢复手段(rollback=0);论文、作者、arXiv 链接齐全,出处标注较好,但出版方未经注册表验证,故 source_attribution=2。
README 与 package. 之间名称、定位大体一致,但内容极薄,无内部文件可交叉印证(self_consistency=1);依赖 npx skills 与目标 Agent 环境,无任何可用性保障或版本要求说明(dependency_availability=1);通篇无错误处理、失败消息或降级行为的描述(failure_messages=0)。
Features 清楚列出适用场景(RAG 评审、方法论提炼、人物技能等),受众明确(audience_and_scenarios=2);但技能产物可靠性的边界仅有一句"证据范围判定",无约束说明(capability_boundaries=1);触发方式仅为自然语言描述,无精确触发条件或防误触机制(trigger_precision=1);明确支持 Claude Code 与 Codex 并给出安装命令,环境适配说明尚可(environment_fit=2)。
README 结构清晰但 TECHNICAL.md、skills/ 目录内容均未在证据中呈现,信息架构可确认度低(information_architecture=1);三种安装方式(Agent 指令、npx、单技能安装)描述清楚(install_notes=2);SkillAlchemy 命名在 README 与 package. 一致(naming_stability=2);仅有用法示例、无 FAQ(examples_and_faq=1);完全没有已知限制、失败案例或适用边界声明(known_limitations=0);MIT License 文件完整且与元数据一致(license=3);package. 标 v1.0 但无 CHANGELOG 或版本历史(versioning_changelog=1);无维护者、更新策略或支持渠道说明,出版方身份未经验证(maintenance_responsibility=0)。
产物写入 output/ 的路径明确,但产物格式、结构、质量标准未在可见文件中定义(output_usability=1);宣称的 55.8% 通过率等收益数据无法在仓库内验证,边际价值仅是断言(marginal_value=1);成本(Token、网络抓取量)与收益权衡完全未讨论(cost_benefit=1)。
性能声明指向 arXiv 论文,但注意:编号 2608.23417 与"2026 年"日期、以及 DeepSeek-V4-Pro、Opus 4.8、GPT-5.5 等模型名在本次静态审查时点上均无法核实,属于不可追溯的声明(claim_traceability=1);仓库内无任何第二来源可佐证基准结果(cross_source_corroboration=0);README 将实验结果与产品描述混排,未标注证据等级(fact_inference_separation=1)。
- README 中的基准数据(55.8% 通过率等)与 arXiv 编号、模型名称在本次静态审查中均无法核实,请勿视为已证事实。
- 系统具有开放网络抓取与本地文件写入能力,但无权限边界、确认机制或回滚说明;建议在隔离环境中先行试用。
- Distill people
- 会基于真人公开信息生成 Persona 技能,存在隐私与名誉风险,且仓库无任何隐私处理政策。
- 出版方身份未经注册表验证,仓库缺少维护者与更新承诺信息,长期可用性未知。
- 无已知限制、无 CHANGELOG、无失败处理文档,生产环境采用前需自行审计实际生成的技能内容。
这个 Agent 能做什么,适合哪些场景?
SkillAlchemy 是一个开源的开放世界智能体技能创造系统,出自论文《SkillAlchemy: Open-World Agent Skill Creation》。它面向陌生领域的任务:原始技能简报往往省略关键需求,专家流程可能不存在,执行轨迹也难以获取。为此,它把技能创造建模为「基于来源的流程准入」问题:先从简报中挖掘被省略的隐含需求,再从文档、代码仓库、论文、issue 等公开来源获取有据可依的流程,并判定每条流程的证据支撑范围(可复用指令、限定范围的示例,或予以排除)。最终它将准入的知识编译为智能体可直接加载安装的 Skill 包,输出写入当前项目的 output/ 目录。它兼容 Claude Code 和 Codex 两种智能体,并附带 Lens、LEAP 等可单独安装的技能。在 SkillsBench v1.1 的 87 个任务上,四种智能体-模型配置平均任务通过率达 55.8%,略超人工精选技能。项目采用 MIT 许可证发布。
SkillAlchemy 的端到端流程是:读取一个欠规范的技能简报(例如「创建一个审查 RAG 系统的 Skill」),首先发现简报中缺失的隐含需求、约束和运行维度;然后从异构公开来源(文档、仓库、论文、issue 报告等)获取候选流程,评估每条流程的证据支撑广度,决定其是可复用指令、限定范围示例还是应排除;可选能力包括把人物(决策、失败、价值观、沟通风格)提炼为 Persona Skill、把方法论提炼为含条件/步骤/分支/失败处理的技能,以及融合既有工作流为新能力。最终它将准入的流程、示例、引用和支撑资源编译为可安装的 Skill 包写入 output/。技能可通过 npx skills add 安装到 Claude Code 或 Codex 中加载使用。
- 需要在陌生技术领域(如 RAG 系统审查)创建智能体技能、但缺乏现成专家流程文档的工程师,希望系统从公开文档和论文中自行补全需求并生成技能
- 希望把某位专家的方法论、书籍或访谈内容转化为可执行、可分支、带失败处理的智能体技能的知识工作者
- 维护智能体团队的技术负责人,想用融合(Fuse)能力把多个既有工作流或领域知识合并为一个新技能
- 研究自动化技能创造的学者,需要在 SkillsBench 上对比自动生成技能与人工精选技能的效果
- 使用 Claude Code 或 Codex 的用户,想一键安装 Lens、LEAP 等现成技能来增强自己的智能体
这个 Agent 有哪些优点和局限?
- 有量化评测支撑:在 SkillsBench v1.1 的 87 个任务上,四种智能体-模型配置平均通过率 55.8%,其中 3/4 配置为最高,比无技能执行高 19.9 个百分点
- 表现与人工精选技能相当(54.4%)并略有超越,且比最强的自动技能创建基线高 8.6 个百分点
- 独特的证据准入机制:区分可复用指令与仅限特定上下文的示例,而非把所有检索结果当作普遍有效
- 同时支持 Claude Code 和 Codex,技能也可单独安装复用,MIT 许可证便于集成
- 依赖 Claude Code 或 Codex 作为运行时智能体,无法脱离这两类宿主直接运行(其他智能体平台未提及支持)
- 评测中并非全胜:在 Codex + DeepSeek-V4-Pro 配置下(43.9%)反而低于人工精选技能的 45.7%
- 安装依赖 npx skills CLI,需要 Node.js 环境;README 未说明离线或受限网络下如何运行,开放世界来源获取依赖网络访问
- 论文标注为 2026 年 arXiv 预印本(arXiv:2608.23417),尚非经同行评审的成果,技术细节需自行核验
如何安装或部署这个 Agent?
最简单的方式是直接让 Claude Code 或 Codex 安装:「Install SkillAlchemy from https://github.com/agentsope/SkillAlchemy and show me how to use it.」。也可以用命令行安装:npx skills add agentsope/SkillAlchemy。需要 Node.js 环境以运行 npx。也可单独安装组件:npx skills add agentsope/SkillAlchemy/skills/Lens、npx skills add agentsope/SkillAlchemy/skills/LEAP,或任意 skills/<skill-name>。
如何使用这个 Agent?
安装后,用自然语言描述你想创建的技能,并指定来源,例如:「Use SkillAlchemy to create a Skill for reviewing RAG systems. Use public documentation and research papers as sources.」SkillAlchemy 会挖掘隐含需求、从公开来源获取流程、判定证据支撑范围,并将生成的技能包写入当前项目的 output/ 目录;随后智能体可直接加载该技能使用。支持的目标智能体为 Claude Code 和 Codex。
这个 Agent 与同类方案有什么区别?
README 的评测表将其与 Anthropic Skill-Creator、OpenAI Skill-Creator、OpenSkill、MUSE-Autoskill 以及人工精选技能直接对比;平均通过率上 SkillAlchemy(55.8%)超过这些自动基线(最高为 MUSE-Autoskill 的 47.2%),也略超人工精选技能(54.4%),适合需要在陌生领域自动创建技能、而非依赖官方 Skill-Creator 模板的用户。