开发与工程 claude-code-pluginskill-distillationagent-evaluationadversarial-verificationdomain-adaptersworkflow-method

寓言方法论(Fable Method)——可蒸馏的智能体工作流

把 Claude Fable 5 的工作方式蒸馏成可执行的技能、循环和验证器,用一套陷阱测试集保证诚实。

FollowAgents 评估 · FARS-2.1
不推荐
55/ 100 五分制 2.8 / 5
1 2 3 4 5 6
1信任安全12 / 29 · 2.1/5

证据显示:插件以最小权限运行,但未明确声明权限边界;用户确认机制存在(计划停止、授权门),但未详细说明;数据流透明度有限,未说明数据如何被处理或传输;敏感数据处理未明确;依赖安全未审计;外部影响(如部署)有授权门,但未全面;回滚机制未明确;来源归属清晰(MIT许可,作者Sahir619)。扣分:权限边界、数据流、敏感数据、依赖安全、外部影响、回滚均未充分说明。

2可靠稳定8 / 14 · 2.9/5

证据显示:方法内部一致,规则与流程匹配;依赖可用性未明确(如外部API);失败消息有硬界限(3次验证失败停止),但未详细说明错误处理。扣分:依赖可用性未说明。

3适用触发12 / 18 · 3.3/5

证据显示:明确目标受众(Claude Code用户、其他代理);能力边界清晰(拒绝医疗等红线领域);触发精确(分类步骤);环境适配(插件、独立技能、AGENTS.md)。扣分:无重大扣分,但环境适配未全面测试。

4规范维护10 / 18 · 2.8/5

证据显示:信息架构清晰(目录结构);安装说明详细;命名稳定(命名空间);示例和FAQ有(examples.md);已知限制有(null结果);许可证MIT;版本化变更日志有(DOC.md提及变更);维护责任未明确。扣分:维护责任未明确。

5有效结果9 / 13 · 3.5/5

证据显示:输出可用性高(报告格式明确);边际价值有(陷阱场景提升);成本效益有(小任务无提升,但陷阱场景提升)。扣分:无重大扣分,但成本效益未量化。

6证据核验4 / 8 · 2.5/5

证据显示:声明可追溯(链接到eval结果);跨来源佐证有限(仅内部eval);事实与推断分离(明确区分)。扣分:跨来源佐证不足。

证据充分度: 评估于 2026年8月9日 审查版本 88b5cf36b10e
使用前请注意
  • 静态审查,未执行代码,所有结论基于文件内容。
  • eval结果基于LLM判断,样本量小(1-4次运行),可能不可靠。
  • 依赖安全未审计,外部API使用未明确。
  • 维护责任不明确,社区贡献路径开放但未落实。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

寓言方法论是一个 Claude Code 插件,将 Claude Fable 5 在订阅下架前对自身问题处理方式的反思,提炼成四个技能:fable-method(思考)、fable-loop(行动)、fable-judge(证明)和 fable-domain(成长)。每个技能都定义了明确的步骤、阈值和逃生通道,使中端模型也能按字面执行。该方法的核心是六步循环:分类、定义完成、收集证据、决策、行动、验证,并带有强制的人为产物(如 INTENT 行)以确保可问责。仓库包含 15 轮评估、超过 260 次智能体运行和 14 个陷阱场景,证明该方法能提升 Haiku 和 Sonnet 等低端模型的性能,尤其是在对抗性陷阱中。该方法还包含八个领域适配器(营销、研究、数据、业务、金融、法律、设计、DevOps)和一个 schema(TEMPLATE.md),而 fable-domain 技能可以生成新的适配器,并附带陷阱装置和烟雾评估。

作为 Claude Code 插件安装后,提供四个带命名空间的斜杠命令:/fable-method 应用循环规则,/fable-loop 运行完整的编排流程(并行证据子智能体 → 单一承诺计划 → 主线程执行 → 对抗性验证器 → 审计报告),/fable-judge 对已完成工作进行对抗性验证(重新运行声称的检查、对比差异、寻找被削弱的测试和虚假完成声明,返回 VERIFIED / CAVEATS / REFUTED),/fable-domain 为新领域生成适配器包(适配器、陷阱装置、烟雾评估)。fable-method 还支持 plan(生成计划并停止)、audit(对已完成工作按循环分级)和 report(以结果优先的方式重写答案)。它从 eval/scenarios/ 读取陷阱装置,从 eval/results/ 读取原始裁判 JSON 输出,并遵循 skills/fable-method/SKILL.md 中定义的规则。它不会向外部 API 发送数据,所有处理都在 Claude Code 上下文中进行。

  1. 希望获得结构化的逐步方法(包括分类、定义完成、证据收集和验证)来处理非平凡编码任务的开发者,而不是自由形式的提示。
  2. 使用 Haiku 或 Sonnet 等较弱型号、并希望更可靠地识别规范冲突或虚假成功陈述的团队,例如 s2 惊喜陷阱或 s7 欺诈性工作场景。
  3. 需要为营销、研究或 DevOps 等领域生成可信任适配器,并希望适配器附带陷阱装置和烟雾评估来确保质量的运营者。
  4. 需要对其智能体工作进行对抗性审计的工程团队,要求 /fable-judge 验证声明并揭露被削弱的测试或未观察到的所谓检查。
  5. 对智能体方法论研究感兴趣的研究者,他们希望复现仓库中的评估,使用 /fable-judge suite 语法或 eval/README.md。
  6. 将 fable-method 的 AGENTS.md 适配到其他工具(Codex、Cursor、aider)的用户,希望在不同环境中获得相同的方法。

这个 Agent 有哪些优点和局限?

优点
  • 基于证据的规则:每个规则都源于失败的测试或观察到的痕迹,并有指向提交记录的链接。
  • 包括一套对抗性陷阱装置(如 s7 欺诈性工作)和盲 LLM 裁判,它们通过差异和执行进行验证,而不仅仅是阅读报告。
  • 显示对较弱模型(Haiku、Sonnet)的提升,尤其是在陷阱上,同时承认对常见小任务的零提升,验证了其适用范围。
  • 可转移:提供了一个 AGENTS.md,用于其他智能体(Codex、Cursor、aider),并且 fable-domain 可以生成新的领域适配器。
局限
  • 纯 Claude Code 插件,需要 Anthropic 生态,不适用于其他平台。
  • 评估为冒烟测试级别,每个单元仅 1-4 次运行,可能存在统计不确定性和 LLM 裁判的偏差。
  • 该方法无法让模型知识更新,在知识密集的研究任务中可能不如前沿模型。
  • 需要网络访问来获取源和运行评估,并且没有明确的成本估计,但可能涉及多次 LLM 调用。
  • 文档大量依赖特定于存储库的术语和图表,新用户可能需要大量阅读才能有效应用。

如何安装或部署这个 Agent?

在 Claude Code 会话中,运行以下命令安装插件:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

这会安装四个技能,命名空间为 /fable:。作为独立技能(不带命名空间),可使用:

git clone https://github.com/Sahir619/fable-method && bash fable-method/install.sh

Windows PowerShell: git clone https://github.com/Sahir619/fable-method; .\fable-method\install.ps1

如何使用这个 Agent?

安装后,使用斜杠命令,例如:
- /fable-method <任务> 应用循环。
- /fable-method plan <任务> 分类、定义完成、收集证据并生成计划,然后停止。
- /fable-loop <任务> 运行完整的编排流程。
- /fable-judge 对已完成工作进行验证。
- /fable-judge suite <目标> 对任何技能、模型或提示运行仓库的陷阱套件。
- /fable-domain <领域> 为新领域生成适配器包。
建议在 ~/.claude/CLAUDE.md 中添加主动触发规则,例如:“在任意非平凡的多步骤任务之前,应用 fable-method 循环;对于无人值守或子智能体任务,使用 fable-loop。”和“在呈现任何声称完成的工作之前,运行 fable-judge 检查。”

常见问题

此方法是否适用于所有任务?
不,它专为陷阱而设计:权威冲突、虚假完成声明、弱执行者和无人值守的运行。对于简单任务或大型模型,它不增加价值,仓库明确记录了这些空结果。
我可以在其他智能体中使用吗?
是的,提供 AGENTS.md,其内容在不含 Claude 特定前端的情况下相同,包括适用于任何模型提示。然而,插件本身仅适用于 Claude Code。
我需要付费的 Anthropic 订阅吗?
该插件是为 Claude Code 构建的,需要有效的 Claude Code 订阅或 API 密钥。仓库未提及任何免费层。
fable-domain 如何处理受限领域?
它拒绝医疗、法律和金融建议等领域,因为这些需要执照或可能造成伤害。它还会在新领域看起来只是伪装成代码时提前停止。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents