开发与工程 skill-contractsclirisk-reportingalignment-verificationskill-securityagent-evalsrustplugin-marketplace

SkillSpec

让智能体技能真正可被遵循:一条命令评估风险,一份契约约束行为,一次运行留下可审计的对齐证据。

FollowAgents 评估 · FARS-2.1
谨慎使用
74/ 100 五分制 3.7 / 5
1 2 3 4 5 6
1信任安全19 / 29 · 3.3/5

boundary 子命令明确提供 deny-by-default 最小权限策略、静态分析且不执行包内代码、pull/update 安装前先展示风险并请求确认,是本次评估中最强的信任证据;扣分点:推荐的主安装方式是 curl | sh 远程脚本,敏感数据处理与日志去向未见明确说明, publisher 身份未经验证, source attribution 依赖单一未验证发布者。

2可靠稳定9 / 14 · 3.2/5

CI 覆盖 fmt/clippy/locked tests、三平台矩阵、dogfood doctor、示例与 conformance 正反向 fixture,锁定构建提升一致性;扣分点:doctor 评分阈值的稳定性仅由文档断言,无独立运行验证,失败信息只在 workflow 脚本层面可见。

3适用触发16 / 18 · 4.4/5

明确支持 Codex/Claude Code/AGENTS.md 等多 harness,boundary 可独立使用(不要求采用整个 SkillSpec),'It is / It is not' 表清楚划定能力边界(不是沙箱、不保证 harness 行为一致);触发精度方面 import/router 由自然语言指令驱动,具体触发判定文件未在证据中展示。

4规范维护14 / 18 · 3.9/5

文档结构完整(install、security-quickstart、boundary-guide、design/operations 目录、贡献指南),license 为 MIT/Apache 双许可并在 Cargo.toml 一致声明,'is/is not' 与已知局限(非沙箱、私有仓库不公开检查)坦率;扣分点:未见 CHANGELOG 文件,版本历史与维护者/更新路径信息薄弱,v0.1.0 示例暗示早期阶段。

5有效结果10 / 13 · 3.8/5

输出可用性高:doctor 提供 text/markdown/html/ 多格式报告、按严重性分级、附带证据链接与后续步骤;扣分点:边际价值与成本收益依赖 'agent 真会更遵循契约' 的假设,该效果未在证据中被独立证明,loop 需要用户 adopt 多个组件。

6证据核验6 / 8 · 3.8/5

doctor 声称每条风险条件引用已发表研究并区分实测值与策略阈值,CI dogfood 和 conformance 套件使声明可追溯,boundary 用固定 commit SHA 使证据链接持久;扣分点:引用的 docs 文件本身未在本次证据中展示,跨源佐证只能基于 README 与 workflow 的一致性,无法核实方法论文档内容。

证据充分度: 评估于 2026年9月9日 审查版本 f4d9ab57aa23
使用前请注意
  • 推荐的 curl | sh 安装方式会在未经审查的情况下执行远程脚本;建议改用 Cargo 安装或先下载并核对 .sha256 校验和后再运行。
  • 发布者身份未经 FollowAgents 注册表验证,依赖此工具做安全决策(如 boundary guard)前请自行审计源码。
  • SkillSpec 明确声明自己不是安全沙箱:契约与对齐报告是可审计记录,不强制工具边界,强制仍由 harness 负责。
  • doctor 的风险评分阈值为策略设定而非实测标准,具体效果(契约提升遵循率)未经执行验证。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

SkillSpec 是一个 Rust 编写的 CLI 工具,解决的核心问题是:写好的 SKILL.md 只是文本,智能体可能跳过靠后的安全规则、使用未声明的工具、或在没有任何证据的情况下声称“完成”。它通过 skillspec doctor 对任意技能生成风险报告,揭示埋藏义务、上下文负载、未声明依赖和缺失的验证手段。随后通过 skillspec import 将散文式技能移植为 skill.spec.yml 结构化契约(路由、禁止项、依赖、检查和证明要求),并编译一个保持小上下文的加载器。每次运行可产出对齐摘要,记录所选路由、完成步骤、token 用量与禁止项状态。boundary 子命令还能分析技能可触达的网络主机、文件路径和凭据,生成默认拒绝的最小权限策略。它不是新的智能体运行时,也不是安全沙箱,而是让技能运行结果可审计的契约层,支持通过插件市场集成 Claude Code 与 Codex。

工作流分为三步:评估、移植、证明。1) 评估:skillspec doctor ./my-skill 对本地目录或公开 GitHub URL 输出风险报告(发现项、后果、下一步建议),报告可通过 --markdown/--html/-- 导出;托管页面 skillspec.sh 可粘贴公开技能 URL 免安装试用。2) 移植:/skillspec import <skill> 生成 skill.spec.yml(路由、规则、禁止操作、依赖、检查、测试、证明期望)并编译轻量加载器。3) 证明:每次运行生成对齐摘要,包含所选路由、完成步骤、缺失证明、禁止项状态、token 与耗时指标。skillspec install router 通过路由器模式解决技能库拥挤问题。skillspec boundary map/assess/emit/guard 分析技能的结构和可达资源(主机、路径、二进制、凭据),按严重级别排序,生成拒绝默认策略并可执行防护;skillspec pull 在安装前评估远程 git 技能,skillspec update 在替换前展示能力变化。boundary 是独立工具,无需 skill.spec.yml,且不执行包内任何代码。

  1. 技能作者在发布前用 Doctor 检查 SKILL.md 是否存在埋藏规则、上下文超载或未声明工具等导致智能体偏离的风险。
  2. 团队在采纳第三方技能前,用 skillspec pull 和 boundary assess 评估其可触达的网络、路径与凭据,再决定是否安装。
  3. 依赖关键技能的工程团队将散文技能移植为结构化契约,使每次运行都有可审计的对齐摘要而非仅“完成”两个字。
  4. 维护大量技能库的用户启用 router 模式,避免 harness 列表预算导致技能发现不可靠。
  5. 跨 Claude Code、Codex 等 harness 工作的团队,希望技能契约和运行记录可比较、可随仓库或 PR 发布供评审。
  6. 安全评审者通过 GitHub issue 模板请求公开技能的 Doctor 报告,由 Actions 自动生成 Markdown/HTML/JSON 报告与附件。

这个 Agent 有哪些优点和局限?

优点
  • Doctor 风险评分基于已发表研究与本地方法学(上下文位置效应、有效上下文限制、可验证指令遵循等),报告明确区分实测项与策略阈值。
  • 契约是真实规范:带类型的 Rust 模型、JSON Schema、参考语法和一致性测试套件,可审计可比较。
  • boundary 是独立工具,无需采纳整个 SkillSpec、无需 skill.spec.yml,且评估时不执行包内代码,可安装前评估公开 git 技能。
  • 同时支持 Claude Code 与 Codex 的插件市场安装,并提供 CLI 安装到多种 harness 目标,跨平台技能可比较。
  • 运行产物是对齐摘要(路由、步骤、禁止项、token、耗时),使技能结果可核查而非仅凭最终回答。
局限
  • SkillSpec 明确不是安全沙箱:它使运行可审计,但工具边界的强制执行仍依赖 harness。
  • 主要插件市场集成路径仅覆盖 Claude Code 和 Codex,其他 harness 需通过 skillspec install skill 手动安装技能目录。
  • 公开 Doctor 报告的 GitHub Actions 不检查私有仓库,私有技能只能本地安装后自评。
  • 强制最小权限策略需额外运行 boundary emit 与 boundary guard install,且策略本身仍需人工评审。
  • Rust CLI 加上 skill.spec.yml 契约文件意味着团队需要学习一套新的规范与命令体系。

如何安装或部署这个 Agent?

方式一(安装脚本):curl -fsSL https://skillspec.sh/install.sh | sh,然后 skillspec --version 验证。安装脚本校验 SHA256 并默认写入 ~/.local/bin,可通过 SKILLSPEC_VERSION 和 SKILLSPEC_INSTALL_DIR 环境变量固定版本与目录。方式二(Cargo):cargo install skillspec。方式三(插件):Claude Code 执行 claude plugin marketplace add modiqo/skillspec --sparse .claude-plugin plugins/skillspec 后 claude plugin install skillspec@skillspec;Codex 执行 codex plugin marketplace add modiqo/skillspec --ref main --sparse .agents --sparse plugins/skillspec 后 codex plugin add skillspec@skillspec。预编译二进制(macOS/Linux/Windows)在 GitHub releases 页提供。无需账号或 API 密钥。

如何使用这个 Agent?

首次试用无需安装:在 skillspec.sh 粘贴公开技能 URL 获取 Doctor 报告。本地基本流程:1) skillspec doctor ./my-skill 获取风险评估基线;2) 在聊天中对智能体下指令:/skillspec import ./my-skill, compile it, verify it, test it, and prove it. Print the alignment summary,生成 skill.spec.yml 并安装;3) 审阅对齐摘要。安全评估:skillspec boundary map <skill-or-git-url> 查看结构,boundary assess 按风险排序,boundary emit 生成默认拒绝策略,boundary guard install 执行策略;skillspec pull <git-url> 安装前评估,skillspec update 更新前对比能力变化。本地开发可用仓库 Justfile(just install-skill codex / just preflight 等)。

这个 Agent 与同类方案有什么区别?

README 将 SkillSpec 明确定位为“不是新的智能体运行时,也不是编排平台”,即它与 Claude Code、Codex 等 harness 互补而非竞争;文档还提到其 Rote 能力用于捕获持久执行轨迹,可将观察到的 CLI/API/MCP 工作转为可复用技能。

常见问题

需要 API 密钥或付费服务吗?
文档未提及任何账号、密钥或付费要求;CLI 可直接对本地技能运行,托管 Doctor 页面 skillspec.sh 可免安装试用公开技能。
它在我的任务结束后能保证技能被强制执行吗?
不能。README 明确说明 SkillSpec 使运行可审计(可对照契约核查声明),但工具边界的强制执行仍是 harness 的职责。
我用的 harness 不是 Claude Code 或 Codex,能用吗?
可以部分使用:Doctor、boundary 等是独立 CLI,对任何 AGENTS.md/SKILL.md harness 都能分析;契约技能可通过 skillspec install skill 安装到 codex、agents、claude-local 等目标。
不采纳整个 SkillSpec 也能做安全评估吗?
能。boundary 是独立工具,无需 skill.spec.yml、不改动技能、不执行包内代码,可对本地目录或公开 git URL 单独运行。
许可证是什么?
仓库标注为 Apache-2.0;README 说明代码采用 MIT / Apache-2.0 双许可,可任选其一,贡献默认按同一双许可接受。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents