开发与工程 multi-model-orchestrationcost-optimizationcode-reviewsubagentspolicy-templatemodel-routing

Pilotfish 多模型編排層

讓前沿模型專責規劃與判斷,廉價模型處理搜索、重複編輯與測試,新鮮上下文驗證器把關品質,一次提示即可安裝。

FollowAgents 评估 · FARS-2.1
推荐
81/ 100 五分制 4.1 / 5
1 2 3 4 5 6
1信任安全23 / 29 · 4.0/5

证据显示最小权限与用户确认处理扎实:只读角色的工具白名单、verifier 禁止写操作、安装器显示合并计划并要求批准后才写入,均有测试固化;回滚路径(备份、卸载、恢复计划、插件禁用/启用)完整,得满分。扣分项:数据流与敏感数据仅靠策略文本中的提示(如 security-reviewer 的 WebSearch/WebFetch 出网与『不传密钥』),缺少更结构化的数据流说明;外部效果方面全局配置写入与 SessionStart 钩子注入虽有披露但影响面较大;来源归属有 ATTRIBUTION.md 与设计致谢,但发布者身份未经注册表核实,维持中等评分。

2可靠稳定11 / 14 · 3.9/5

自洽性极佳:测试以字节级校验强制 README、安装文档、manifest、策略模板间一致,属于超出平均的证据。扣分项:依赖可用性依赖 Claude Code 2.1.219+ 的具体版本约束,Linux 仅合同性声明未实测;故障消息只见文档化排障指引,实际运行失败路径的提示质量无法从静态源验证,故仅给 2。

3适用触发15 / 18 · 4.2/5

受众与场景清晰(宿主对照表、多种安装路径),能力边界与已知限制披露得异常充分(自动委派不保证、beta 不声称稳定可靠性、Linux/Windows 限制),这两项得满分。扣分项:触发精度受宿主限制——自述更高优先级指令可抑制 Agent 派发,仅提供缓解性话术;环境适配方面 macOS 实测、Linux 未验证、Windows 排除,诚实但覆盖有限。

4规范维护16 / 18 · 4.4/5

信息架构、安装说明、命名稳定性、已知限制、许可与版本化均处理到位:目录、表格、runbook、版本化 pilotfish:begin/end 块、VERSION/CHANGELOG/plugin manifest 联动且有测试锁定,LICENSE 在插件内复制并测试一致,均值得满分。扣分项:FAQ 未见专门内容,示例主要集中于安装/卸载提示;维护责任仅见赞助说明与贡献指南,缺少明确的维护承诺或治理路径。

5有效结果9 / 13 · 3.5/5

输出可用性方面角色契约(READY/REVISE、CONFIRMED/REFUTED/INCONCLUSIVE)定义清楚,但静态源中未直接呈现完整输出规范,给 2。边际价值与成本收益有研究文档和基准佐证,但成本节省的量化主张标注为行为观察而非结论,且需付费运行复核,未达满分是合理扣分。

6证据核验7 / 8 · 4.4/5

主张可追溯性强:链接到 issue #23、上游 PR、多个基准目录、文档核查日期,且测试逐短语锁定声明。事实与推断分离是本仓库亮点——明确区分行为观察与派发率结论、明确标注 Linux 未实测,得满分。扣分项:跨源佐证主要来自内部一致性测试与上游致谢,缺少独立第三方证据。

证据充分度: 评估于 2026年9月7日 审查版本 ea0d20bbc963
使用前请注意
  • 策略会写入全局 ~/.claude/CLAUDE.md 与 agents/,影响未来所有会话;安装前务必审阅钉住的检出内容并在合并计划批准前确认。
  • Plugin beta 的 SessionStart 钩子会向每个会话注入策略文本;beta 明确不承诺稳定可靠性、跨版本兼容或命名空间无冲突,生产环境慎用。
  • Linux 支持仅为合同性声明,未测试未验证;Windows 不在范围内。自动委派不保证生效,关键任务需手动激活话术。
  • 发布者身份未经企业注册表核实;成本节省与行为主张未经独立复核,需付费运行验证。
  • 安装器对已有 settings. 的 availableModels allowlist 追加项默认保留,卸载时需显式请求恢复。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Pilotfish(GitHub: Nanako0129/pilotfish)是一套針對 Claude Code 的多模型編排策略,而非獨立可執行程式。它由三個安裝目標構成:~/.claude/settings. 中的主模型別名與後備鏈、~/.claude/agents/ 下八個角色代理檔案,以及 ~/.claude/CLAUDE.md 中的版本化策略區塊。執行模型分工明確:主會話使用 opus 系列別名負責規劃、決策、規格與審查;scout 與 Explore 用 Haiku 做唯讀偵察;mech-executor 與 executor 用 Sonnet 執行機械性或經核准的實作;plan-verifier、security-reviewer、verifier 與 security-executor 則以 Opus 在核准邊界與風險觸發時提供新鮮上下文審查。安裝方式有兩種:macOS/Linux 的 Plugin beta(基於 SessionStart hooks 的環境式啟用)與舊式全域安裝(需 Claude Code 2.1.219 以上)。安裝程式具備等冪性,寫入前會顯示合併計畫並要求使用者核准,所有變更皆可復原。專案以 MIT 授權,並附有基準測試與行為證據文件,明確標示其宣告範圍。

安裝後,pilotfish 在每次 Claude Code 會話中依策略分派工作。主會話先依結果清晰度選擇互動形態:co_discover(結果或驗收不明)、explore_then_plan(方向廣泛或高影響)或 execute(有界明確任務)。接著編排器可呼叫具名代理:scout(Haiku、低 effort)進行唯讀倉庫偵察;plan-verifier(Opus、唯讀)在核准前以 READY 或結構化 REVISE 挑戰計畫;mech-executor(Sonnet)執行完整規格化的機械重複;executor(Sonnet)處理需本地判斷的核准實作;security-reviewer(Opus、唯讀)收集安全證據;security-executor(Opus、高 effort)執行經核准的安全敏感工作;最後由 verifier(Opus、新鮮上下文)以 CONFIRMED / REFUTED / INCONCLUSIVE 偽證實作結果。策略區塊同時定義派送煞車:小而穩定的工作留在主會話,僅在角色契約穩定且委派有正向淨效益時才拆分。Plugin beta 透過 Claude Code 原生 Plugin 生命週期與 SessionStart hooks 提供環境式啟用;另可選安裝 /pilotfish 斜線命令或 CLI 包裝器來主動啟用。

  1. 長時間編碼會話的使用者,希望把搜索、重複編輯、測試與文件等大量工作導向 Haiku/Sonnet,只把前沿判斷留給 Opus,以降低 token 成本
  2. 需要在實作被核准前由獨立新鮮上下文審查計畫的團隊,透過 plan-verifier 的 READY/REVISE 關卡把關
  3. 處理安全敏感程式碼的開發者,可先用唯讀 security-reviewer 收集證據,核准後再由 security-executor 執行
  4. 已有 Claude Code 全域 v1 安裝的使用者,可依 Plugin beta 指南遷移到原生 Plugin 生命週期並獲得環境式啟用
  5. 跨多個主機工具工作的使用者,可搭配同系列的 remora(GPT 路由)、pilotfish-grok 或 pilotfish-codex 變體

这个 Agent 有哪些优点和局限?

优点
  • 明確的成本分工:機械性與偵察工作由 Haiku/Sonnet 承擔,Opus 只用於規劃、審查與驗證,直接針對「多數 token 花在非判斷工作」的問題
  • 品質邊界有新鮮上下文把關:verifier 以 CONFIRMED/REFUTED/INCONCLUSIVE 偽證結果,plan-verifier 在核准前挑戰計畫,而非只依賴主會話自我評估
  • 安裝程式等冪、寫前顯示合併計畫並要求核准,所有變更可逆;倉庫附基準測試與行為證據文件,明確標示宣告範圍
局限
  • 綁定 Claude Code 生態:主策略僅適用於 Claude Code;跨 GPT/Grok/Codex 需改用同系列其他變體(remora、pilotfish-grok、pilotfish-codex)
  • 自動委派不保證發生:更高優先級的 Claude Code 指令可抑制代理派送,且使用者層級 CLAUDE.md 無法覆蓋,需手動附上派送煞車提示
  • Plugin beta 僅限 macOS 與 Linux:Linux 僅合約性符合、未經實測驗證,Windows 明確排除,且 Plugin 與舊式全域安裝不可共存;beta 不承諾穩定可靠性與跨版本相容性
  • 成本結構改變:Opus 用於主會話、驗證與安全角色,若任務本質簡單,可能反而增加前端判斷成本

如何安装或部署这个 Agent?

方式一(Plugin beta,macOS/Linux):依照 install/PLUGIN-INSTALL.md 使用 Claude Code 原生 marketplace 命令安裝;Linux 需 Ubuntu 20.04+、Debian 10+ 或 Alpine 3.19+;該指南涵蓋從全域 v1 遷移、更新、停用/啟用、解除安裝與回滾。方式二(舊式全域安裝):git clone --branch v1.4.1 --depth 1 https://github.com/Nanako0129/pilotfish.git && cd pilotfish && claude,然後輸入:「Read the local file install/AGENT-INSTALL.md in the current checkout and follow it to install pilotfish into my global Claude Code configuration. Show me the full plan of changes and get my approval before writing anything.」執行階段需求:Claude Code 2.1.219 以上,安裝後須重啟 Claude Code 以重新載入代理目錄與模型設定。需要有效的付費 Anthropic 模型存取(Opus/Sonnet/Haiku)。

如何使用这个 Agent?

安裝並重啟 Claude Code 後,策略會載入每個新會話。安裝 README 建議在需要確保生命週期時於請求中加入:「Use pilotfish. Follow its dispatch brake: keep direct work in the main session and call the named agents only when the policy selects delegation.」日常調整(模型、effort、委派、managed settings)見 docs/usage.md;可用 /pilotfish 斜線命令或 CLI 包裝器(見 install/ACTIVATION-INSTALL.md)為單一任務啟用。要為某個專案停用,使用獨立的 CLAUDE_CONFIG_DIR。解除安裝可委派給 Claude Code:讀取 install/AGENT-INSTALL.md,依其 Uninstall 章節移除八個代理檔案與策略區塊,寫入前先取得核准。

这个 Agent 与同类方案有什么区别?

README 將本倉庫定位為「Claude Code 全域策略」專案,並指向同作者生態中的 remora-cc(Claude Code 搭配會話級 GPT 路由)、pilotfish-grok(Grok Build)與 pilotfish-codex(Codex CLI)。若你的主力環境是 Codex CLI 或 Grok Build,應選對應變體而非本倉庫。

常见问题

它真的能省錢嗎?
倉庫的核心論點是多數編碼會話 token 花在搜索、重複編輯、測試與文件而非前沿判斷,把這些有界路徑導向 Haiku/Sonnet 可省成本。但 opus 別名是預設而非萬用宣告,依據與量測放在 docs/research.md 與 issue #23;實際節省取決於你的工作形態,簡單任務全程用 Opus 主會話可能反而更貴。
安裝會動到哪些檔案?可以復原嗎?
舊式全域安裝會修改 settings.(補上 model 與 fallbackModel、條件式擴充 availableModels 允許清單)、新增八個 agents/ 角色檔案,並在 CLAUDE.md 加入版本化的 pilotfish:begin/end 區塊。安裝前會顯示合併計畫並要求核准;model 可還原、代理檔案與策略區塊可移除,唯允許清單新增項目除非主動要求否則保留。
委派是自動的嗎?
不保證。更高優先級的 Claude Code 指令可以抑制代理派送,使用者層級 CLAUDE.md 無法覆蓋。倉庫建議在請求中明確寫入派送煞車提示,並提供自發性派送的基準測試資料,但明言這是行為觀察而非派送率證明。
支援哪些作業系統?
Plugin beta 針對 macOS 與 Linux(Linux 需 Ubuntu 20.04+、Debian 10+ 或 Alpine 3.19+)。macOS 搭配 Claude Code 2.1.239 有實際觀測紀錄;Linux 僅合約性符合、未經測試;Windows 明確不支援。舊式全域安裝沒有這些額外限制,只需 Claude Code 2.1.219 以上。
安全與信任方面要注意什麼?
策略會載入未來每個會話,屬於高信任變更。倉庫明確要求:核准寫入前先審閱鎖定的 checkout、代理範本與策略範本;不要為了從可變 raw URL 安裝而繞過 WebFetch 提示注入防護。對安全敏感工作,另有唯讀 security-reviewer 在核准前收集證據的設計。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents