开发与工程 skill-engineeringworkflow-packagingevaluationrelease-governancecross-platform-compilationruntime-permissionstelemetrycontinuous-integration

Yao Meta Skill

把重复工作流工程化为可评测、可治理、可移植的智能体技能。

FollowAgents 评估 · FARS-2.1
谨慎使用
65/ 100 五分制 3.3 / 5
1 2 3 4 5 6
1信任安全16 / 29 · 2.8/5

README 明确描述本地优先、仅元数据遥测、禁止原始内容采集、显式来源、自适应提案审批门控、权限探测、发布锁和公开声明守卫;接口夹具也展示了禁止远程内联执行及仅允许远程元数据的策略,因此最小权限、确认、数据流和敏感数据处理有实质设计证据。扣分在于多数保证仍来自产品说明而非所给实现代码;全局安装、GitHub 元数据读取、浏览器原生消息和遥测导入具有外部影响,但逐项同意边界与恢复流程未完整呈现。依赖清单内容、漏洞扫描、锁定或供应链策略未提供;回滚只间接体现在豁免到期、升级检查和发布治理中。来源可定位到仓库及“Yao Team”,但发布者身份未知且没有清晰的个人或组织验证信息。

2可靠稳定8 / 14 · 2.9/5

README、CI 工作流和测试辅助代码形成基本一致的 Python 3.11、make ci-test、打包、安装模拟、权限探测及报告生成流程;无效 YAML 和缺字段夹具表明失败路径被考虑,辅助函数也保留 stdout/stderr 并对返回码进行检查。扣分在于只看到测试编排片段,未看到核心实现、断言结果或完整错误文案;requirements-ci.txt 的内容和外部工具可用性未给出,npx、GitHub、浏览器及多目标客户端依赖的降级能力主要是声明。

3适用触发15 / 18 · 4.2/5

材料细分了新建、团队化、测试发布、发布后维护等场景,并明确区分 YAO、Anthropic 和 OpenAI 方法的适用边界;Skill IR、多目标编译、四种成熟度形态、兼容矩阵和显式排除项构成较完整的能力边界。扣分在于自然语言触发仅给出少量示例,冲突、误触发和负触发规则未展示;环境说明聚焦 Python 3.11、Codex 和若干适配目标,Windows、受限网络、不同 shell 及客户端版本细节不足。

4规范维护14 / 18 · 3.9/5

README 的导航、架构图、生命周期、命令目录和伴随报告形成清晰的信息架构;全局安装、重启、开发环境和 CI 命令写得具体。MIT 正文完整,当前 beta、单评审者证据、缺少提供商执行证据、原生权限和真实遥测等限制被明确披露,因此限制与许可可获满分。扣分在于提供的源码在 Quick Start 后截断,无法确认完整 FAQ、示例质量或所有安装故障说明;1.0/2.0 演进清楚但没有所给 CHANGELOG、标签或迁移发布记录;维护主体只有未经验证的“Yao Team”,缺少联系人、支持渠道和明确更新责任。

5有效结果7 / 13 · 2.7/5

输出被设计为可安装技能包、JSON/Markdown/HTML 报告、审查页面、编译适配器和操作队列,且测试辅助代码展示了这些制品的组合流程;相较单纯提示词模板,统一 IR、评估、治理和可移植发布具有合理增量价值。扣分在于材料没有实际输出样本内容或独立使用结果;91.5 分和 5/5 偏好属于项目自述,后者仅一名评审且理由为空。大量命令、报告和治理关卡可能带来显著维护及上下文成本,未给出量化成本、时延或适用规模阈值。

6证据核验5 / 8 · 3.1/5

README 将多数主张指向具体报告、账本、清单、命令和测试流程,测试辅助代码也以确定的脚本与制品路径交叉连接若干主张,因此具备较好的内部可追踪结构。它还明确区分本地工程分数、单人盲评、计划中的外部证据和真正完成的提供商证据,事实与推断边界处理充分。扣分在于所给材料未包含引用的报告正文、基准方法文件、决策记录、核心脚本或测试结果,跨来源印证主要限于 README、CI 和一个测试辅助文件,无法静态确认多数质量与安全声明。

证据充分度: 评估于 2026年8月14日 审查版本 e15472e1f5dc
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 当前结论仅基于所给静态片段;未执行代码、测试、安装或网络操作。
  • 不要把 README 中的 91.5 分、5/5 盲评或“world-class”治理能力视为独立验证;所引用的报告和决策记录未随材料提供。
  • 安装命令使用 npx 并可进行全局、多代理安装;采用前应固定并审查依赖、确认写入范围,并在隔离环境中验证。
  • 浏览器原生消息、GitHub 元数据访问和遥测导入扩大了数据与权限边界;应核查实际实现是否持续遵守仅元数据、无原始内容和审批门控承诺。
  • 发布者身份未知;如用于企业治理或关键流程,应单独确认维护者、更新渠道、漏洞响应和接管方案。
评估证据 [1][2][3][4][5][6]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Yao Meta Skill 是一个面向可复用智能体技能的工程与治理系统,而不只是提示词生成器。它先把工作流、对话记录、提示词、笔记或运行手册整理成意图模型和平台中立的 Skill IR,再生成精简的 SKILL.md、接口元数据、参考资料、脚本、评测与报告。统一的 scripts/yao.py CLI 覆盖初始化、验证、触发描述优化、目标编译、输出评测、权限探测、打包、安装模拟和发布证据检查。目标编译器支持 OpenAI、Claude、通用 Agent Skills 和 VS Code 取向的交付面,但部分运行时能力只能以元数据表达:当前四个已探测适配器均没有原生权限强制执行。该项目适合需要把个人工作方法升级为长期团队资产的工程团队;若只想写一段简短技能说明,其流程与证据体系可能明显偏重。

系统从原始工作流、提示词集、对话记录、文档模式、笔记或运行手册开始,通过 quickstart 澄清任务、输出、排除项、约束和质量标准。export_skill_ir.py 将 SKILL.md、agents/interface.yaml、清单、评测、资源与报告汇总为 Skill IR;compile_skill.py 和 cross_packager.py 再生成 OpenAI、Claude、generic、Agent Skills 兼容及 VS Code 取向的目标契约和安装包。trigger_eval.py、run_eval_suite.py、optimize_description.py 与 judge_blind_eval.py 检查触发准确性、盲测、对抗样例和路由冲突;run_output_eval.py、run_output_execution.py 与 adjudicate_output_review.py 生成输出断言、执行记录、盲评包和裁决报告。governance_check.py、trust_check.py、probe_runtime_permissions.py、verify_package.py、simulate_install.py、world-class-claim-guard 等组件检查治理元数据、信任边界、权限声明、压缩包安全、临时安装和公开声明边界。最终产物包括技能包、目标适配器、注册表元数据,以及 Skill Overview、Review Studio、回归历史、可移植性、采用漂移和发布证据等 HTML、Markdown 与 JSON 报告。

  1. 智能体开发者有一套反复使用的提示词、笔记或操作流程,希望将其整理成带明确触发条件、输入输出和边界的安装式技能包。
  2. 内部工具团队准备让多人依赖某个个人技能,需要补充所有者、生命周期、评测、权限说明、发布门禁和审阅证据。
  3. 维护多客户端技能库的团队,希望从同一份 Skill IR 编译 OpenAI、Claude、通用 Agent Skills 或 VS Code 取向的适配器,并检查语义降级。
  4. 准备发布 beta 版本的维护者,需要执行包验证、安装模拟、Python 兼容性检查、运行时权限探测和证据一致性检查。
  5. 技能库运营者希望通过不记录参数或原始内容的元数据遥测,观察采用率、触发遗漏、输出问题和版本漂移,再生成需审批的改进提案。
  6. 评测工程师需要用训练、开发、可见留出、盲留出和对抗样例验证技能触发描述,并保留可审计的回归与晋级记录。

这个 Agent 有哪些优点和局限?

优点
  • 以平台中立的 Skill IR 为单一语义层,可从同一模型生成多种目标契约、适配器和兼容性记录。
  • 评测不止做结构检查,还覆盖触发回归、盲留出、对抗样例、独立规则裁判、输出断言、执行证据和人工盲评包。
  • 发布边界具体且可执行,包括包验证、压缩包安全检查、临时安装模拟、权限探测、证据一致性和公开声明防护。
  • 提供统一的 scripts/yao.py CLI、Makefile 与 GitHub Actions 测试路径,可在本地重复运行工程流程。
  • 元数据遥测明确排除命令参数和原始内容,并将长期修改保持为需审批的提案。
局限
  • 体系包含大量报告、账本、门禁和评测组件;对于一次性提示词或小型个人技能,采用与维护成本可能过高。
  • 当前 OpenAI、Claude、generic 和 VS Code 适配器的权限探测结果均为元数据回退,原生权限强制执行适配器数量为零。
  • 仓库自报已适合 beta 和外部测试,但提供商支持的生产证据、独立模型执行、人类盲评深度及真实客户端遥测仍被列为待补证据。
  • 公开的 5/5 盲评结果只来自一名评审者,各案例理由字段仍为空,不能视为广泛独立验证。
  • 本地开发要求 Python 3.11 或更高版本;全局安装使用 npx,多平台输出仍需针对目标客户端核对不支持功能和降级说明。
  • 入门与审阅体验的自评分为 6.5/10,是项目明确承认的主要改进区域。

如何安装或部署这个 Agent?

全局安装到 Codex:

npx -y skills add yaojingang/yao-meta-skill -a codex -g -y

安装到该工具支持的全部智能体:

npx -y skills add yaojingang/yao-meta-skill -a '*' -g -y

安装后重启客户端。进行本地开发需要 Python 3.11 或更高版本:

python3.11 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install --requirement requirements-ci.txt
make ci-test

安装命令通过 npx 获取软件包,因此该步骤需要网络;本地开发和生成产物还需要 shell 与文件系统访问。源码没有要求 API 密钥,但 GitHub 基准扫描、更新检查和 PR 元数据读取等联网功能需要能够访问 GitHub。

如何使用这个 Agent?

安装并重启客户端后,可以直接提出“从这个工作流创建技能”“改进现有技能”“为技能添加评测”等任务。CLI 的首个可工作流程为:

python3 scripts/yao.py quickstart --output-dir .

python3 scripts/yao.py validate my-skill
python3 scripts/yao.py skill-ir . --output-json skill-ir/examples/yao-meta-skill.json
python3 scripts/yao.py compile-skill . --target openai --target claude --target generic --target vscode
python3 scripts/yao.py package . --platform generic --output-dir dist
python3 scripts/yao.py test

创建指定技能也可使用:

python3 scripts/yao.py init my-skill --description "Describe what the skill does."
python3 scripts/yao.py validate my-skill

生成后先查看 reports/skill-interpretation.html,再检查 reports/skill-overview.html 和 reports/review-studio.html 中的解释、评分、阻断项、权限审批与证据路径。若要发布,再运行 package-verify、install-simulate、runtime-permissions 和 evidence-consistency 等门禁。

这个 Agent 与同类方案有什么区别?

项目将 Anthropic Skill Creator 定位为偏对话式、强调人工引导迭代的方法,将 OpenAI Skill Creator 定位为精简技能说明与控制上下文的写作指南;Yao Meta Skill 则面向需要评测、治理、证据、发布门禁和跨平台打包的团队资产。仓库给出的加权工程评审分数分别为 Yao 91.5、Anthropic 67.5、OpenAI 50.5,但该评审是项目自身的本地工程证据,不代表独立的世界级认证。实际也可采用混合流程:先以对话方式起草,再用 Yao 加固边界、评测、打包和发布证据。

常见问题

使用它需要模型 API 密钥或付费服务吗?
源码没有将 API 密钥列为安装或本地测试前提,许多评测与报告可确定性地在本地运行。不过,提供商支持的模型执行属于单独的外部证据类型,GitHub 扫描、更新检查和 PR 元数据功能也需要联网。
它会强制执行技能声明的运行时权限吗?
目前不会在已报告的四个目标适配器中进行原生强制执行。它会生成明确的权限契约、回退说明和残余风险报告,但当前结果是 0 个原生强制适配器、4 个元数据回退。
适合只写一个简单提示词吗?
通常不合适。项目面向可复用、需要维护或跨客户端交付的技能;它自己的方法也要求先判断任务是否值得成为技能,并只在收益合理时增加脚本、评测和治理结构。
遥测会保存用户输入或命令参数吗?
文档描述的是本地优先、仅元数据的遥测:记录命令名、事件类型和结果,不记录参数或原始内容;外部 JSONL 导入前还会进行整文件隐私校验。
现阶段能否据此宣称生产级或世界领先?
不能仅凭现有仓库证据作此结论。项目自述已具备 beta 与外部测试条件,同时明确把生产提供商证据、更多人类证据、原生权限执行和真实客户端遥测列为尚未完成的证据任务。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents