Anchored Standard
先以 Minimal 条件锚定推理轨迹,再按需开放 Standard 工具。
首轮仅暴露两个工具、后续重型工具按需解锁,CI 也只有 contents:read,体现了较好的权限收敛;但常驻 bash、自动阶段提升以及完整 Standard 能力仍带来广泛操作面,且没有逐项用户确认机制。README 详细说明上下文过滤、工具目录变化、持久事件、API 密钥环境变量及外部效果,因此数据流透明度充分;不过未见密钥校验、脱敏、日志防泄漏或敏感数据处置规范。项目无运行时 npm 依赖并声明兼容版本,但 GitHub Actions 仅固定到主版本标签,Harness 又处于可破坏兼容性的预览期。安装会拒绝覆盖现有目录,但未给出完整卸载、状态回退或会话恢复步骤。社区性质、非官方关系、版权和贡献路径均有说明,但给定发布者身份仍未获企业登记验证,维护主体只能部分确认。
模式、阶段转换、持久事件和验证清单大体相互一致,且 package 脚本与 CI 流程吻合;扣分点是 package 描述中的“full Standard tools”与 README 所述“小型常驻目录、重型工具按需解锁”并不完全精确,历史 98/99 成绩也来自不同组合。项目声明零依赖测试、Node 版本和具体 Harness 版本,并提供跨平台 shell 回退,但依赖开发预览版 Harness,较新版本兼容性不保证。文档列出未知键挂载失败、重复适配器降级和 shell 启动失败等情况,但没有展示完整、统一的用户可操作错误消息体系。
README 清楚区分基础模式、零工具锚定、whoami、prefab、永恒 Minimal、wire think 和组合模式,并说明各自成本与场景。工具边界、上下文抑制范围、子代理开关、提升信号和配置默认值均有细致定义;触发规则还区分 tool-call、assistant-message、either 及 compaction 边界,证据充分。环境方面覆盖 Windows、Linux/macOS、NixOS、Node 与 Harness 版本差异,但开发测试明确集中在 Node 24/Windows 和特定预览版提交,因此广泛环境适配仍不算完全。
仓库布局、术语、模式表、配置参考、安装与验证章节组织清楚,各模式自包含且有结构不变量。安装命令同时覆盖 PowerShell 和类 Unix,并避免覆盖已有目标。命名总体稳定且未知配置键会失败,但存在生成副本、多个相近模式及“full Standard”措辞与实际常驻目录不完全一致。示例和验证清单丰富,但来源中没有独立 FAQ。已明确记录停止积极开发、价格限制、样本量不足、成绩来源变化及上游破坏性变更。LICENSE 与 package.json 均明确为 MIT,尽管外部元数据是 NOASSERTION,仓库内许可证据本身完整。只有 0.1.0 版本字段和交接记录,未见正式 changelog 或发布策略。维护者说明仅做维护并给出 Issues/PR 路径,但身份未知且更新承诺有限。
产物提供可复制的自包含预设、明确配置项和检查步骤,对目标 Harness 用户具有实际可用性。两阶段工具面和多种实验模式相对普通 Minimal/Standard 预设有明确增量价值;然而 README 主动承认能力差异在小样本中未解决,98/99 不能归因于当前通用组合。默认模式不增加模型调用,部分变体明确增加每轮或首轮调用,成本披露良好;但维护停止、Harness 兼容风险及未经当前组合重新基准测试限制了总体成本收益评分。
关键机制均指向具体目录、插件、配置键、事件类型、检查命令和预期请求头,且性能声明明确标注历史组合、样本量和置信区间,具有很强的声明可追溯性。package.json、LICENSE 和 CI 可交叉印证版本、许可、测试命令及最低权限,但所给材料不含实际插件代码、测试文件、运行日志或外部 issue 内容,无法在本次静态材料内充分交叉验证核心机制和成绩。事实、观察、推断及尚未解决的效果大小被明确分开,因此该项证据充分。
- 当前通用组合未重新取得所宣传的 Project2 98/99;这些成绩来自较早、工具组合不同的版本。
- 该预设可最终启用 bash 和更重的 Standard 工具,且阶段提升自动发生;在不受信任的工作区或提示上使用前,应另行审查 Harness 的沙箱、审批和工具权限。
- 项目已停止积极开发,并依赖允许破坏性变更的 DeepSeek Harness 预览版;升级 Harness 前应固定版本并重新审查兼容性。
- 未见完整的密钥脱敏、敏感数据处理、卸载或会话回退方案。
- 本评估仅基于所给静态文件,未执行测试,也未检查引用的 issue、外部研究仓库或插件实现。
这个 Agent 能做什么,适合哪些场景?
Anchored Standard 是一组面向 DeepSeek Harness 的实验性 Agent 预设,而不是独立模型或通用 Agent 运行时。基础模式在会话首个模型请求中只暴露官方 Minimal 的 bash 与 str_replace_editor,并通过 context-gate 暂时屏蔽自动注入的运行时上下文;产生持久化 tool/call 或 assistant/message 后,再切换到包含发现工具和已解锁工具的常驻目录。仓库还提供零工具锚定、Whoami 预热、永久 Minimal、线级 think/execute、组合锚定以及带种子轨迹的 prefab 等自包含模式。它通过 agent.cordis.yml、局部 MJS 插件、持久会话事件和 dev_tool_search 完成阶段控制与工具扩展,部署边界是用户本机的 DeepSeek Harness 预设目录。原始 Project2 运行得到 98、99、99,但这些结果来自早期配置;当前通用 prefab 未重新测试,独立复现也尚未确定能力增益。项目截至 2026-08-17 已停止活跃开发,仅在可行时进行缺陷修复和 Harness 兼容性维护。
在基础流程中,context-gate 先拦截 DeepSeek Harness 的两条统一上下文注入路径,使请求 #1 仅保留 Minimal persona、用户消息以及允许的消息类型;tool-bootstrap 同时把可见工具限制为 bash 和 str_replace_editor。会话写入首个持久化 tool/call 或 assistant/message 后,插件从 session.events 推导已晋级状态,请求 #2 起恢复标准上下文,并暴露这两个启动工具、dev_tool_search、skill_search、skill_load 以及模型明确解锁的工具。dev_tool_search 可继续扩大常驻工具集,但系统不会一次性倾倒完整 Standard 目录。zero-anchored-standard 和 whoami-standard 会先运行一次零工具锚定回合;eternal-minimal 始终只显示两个工具,并允许通过 dshx list 或 dshx <tool> '<json>' 调用后台注册的 Standard 工具;wire-think-standard 则使用 deepseek-wire-think 路由,在保留工具定义的同时发送 tool_choice: none,再转回执行阶段。prefab 模式可把打包的成功轨迹注入空白会话。仓库自身不发送遥测,插件也不主动发起网络请求,但模型提供商调用及 web_search 等已解锁能力可能需要网络。
- 正在使用 DeepSeek Harness Standard、希望研究首轮工具 schema 是否会改变 DeepSeek V4 Pro 推理轨迹的开发者。
- 希望首轮保持 Minimal 工具面、后续仍能按需使用 web_search、subagent 或 workflow 等重型工具的 Harness 用户。
- 需要比较双工具、零工具、tool_choice: none、永久 Minimal 和组合式深度门控等实验条件的 Agent 研究者。
- 需要会话恢复后仍保留启动或晋级阶段,并通过持久事件核验请求头和工具目录变化的评测人员。
- 愿意审查本地插件代码并接受实验性、维护模式项目风险的 DeepSeek Harness 高级用户。
这个 Agent 有哪些优点和局限?
- 首轮使用字节一致的 Minimal 工具组合,并通过 context-gate 同时控制运行时上下文与 pre-step 注入,实验条件具体且可核验。
- 晋级状态来自持久化会话事件,恢复和重新载入后仍能保留阶段,而不是只依赖进程内计数。
- 晋级后采用小型常驻目录并通过 dev_tool_search 增量解锁,避免一次性加入完整 Standard 工具面。
- 提供多个自包含实验模式,可直接比较双工具、零工具、永久 Minimal、wire-level tool_choice: none 和组合机制。
- 包含零依赖测试、同步检查和 request/header 验证方法,并明确记录历史成绩的配置出处与局限。
- 核心实现绑定 DeepSeek Harness 的预设、事件和插件接口,没有文档证明可直接用于 ChatGPT、Codex、Claude 或通用 API Agent。
- 只针对 DeepSeek Harness 0.1.0-rc.5 和特定源码提交开发测试;Harness 仍是开发者预览,新版本可能产生破坏性变化。
- 原始 98/99/99 成绩使用的是早期 pwsh + read 及完整 25 工具目录配置,不能归因于当前通用模板;独立复现的能力增益仍不确定。
- 项目已进入维护模式,价格上涨使 Project2 与多轮评测停止,采用者需承担后续兼容和验证成本。
- 零工具与 Whoami 模式每个会话额外消耗一次模型调用;wire think/execute 每回合多一次调用并破坏前缀缓存连续性。
- 预设具有与 shell 访问相同的信任级别,且 Eternal Minimal 的 dshx 网关能执行后台注册的真实工具,安装前必须审查代码与权限。
如何安装或部署这个 Agent?
前置条件是 DeepSeek Harness 0.1.0-rc.5;仓库注明其开发测试环境为 Node.js 24,且 Harness 源码基线为提交 47f9438。克隆仓库后,在 Linux/macOS 安装基础模式可执行:
dsh_home="${DSH_HOME:-$HOME/.dsh}"
mkdir -p "$dsh_home/.agent-presets"
test ! -e "$dsh_home/.agent-presets/anchored-standard"
cp -R preset "$dsh_home/.agent-presets/anchored-standard"PowerShell 可执行:
$target = Join-Path $env:USERPROFILE '.dsh\.agent-presets\anchored-standard'
if (Test-Path -LiteralPath $target) { throw "Preset already exists: $target" }
New-Item -ItemType Directory -Force -Path (Split-Path -Parent $target) | Out-Null
Copy-Item -Recurse -LiteralPath '.\preset' -Destination $target其他模式也可将对应目录单独复制到 .dsh/.agent-presets 下的同名 ID。随后完全重启 DeepSeek Harness,新建空白会话并选择 Anchored Standard (experimental);不要把已有会话从其他预设切换过来。provider-backed 模式需要 DeepSeek 连接配置;wire-think-standard 可从行配置、llm-deepseek 设置或 DEEPSEEK_BASE_URL 与 DEEPSEEK_API_KEY 获取连接信息。prefab 推荐按 prefab/AGENT_INSTALL.md 的安装契约完成设置。
如何使用这个 Agent?
新建空白会话,选择安装的预设,然后发送真实任务。基础 Anchored Standard 的首个请求只看到 bash 和 str_replace_editor;首次工具调用或文本回复持久化后,下一请求会自动进入常驻阶段。需要更重的能力时,让模型调用 dev_tool_search 解锁对应工具;不要期待晋级时直接出现完整 Standard 目录。可导出会话 JSONL 并检查 request/header:首个 tools 数组应严格为 ["bash", "str_replace_editor"],首轮消息不应包含 AGENTS.md/CLAUDE.md 摘要或技能目录提醒,下一次变化的请求头应包含启动工具与 dev_tool_search、skill_search、skill_load。若使用 Eternal Minimal,可在 bash 中运行 dshx list 查看网关工具,并以 dshx web_search '{"query":"..."}' 之类的命令调用真实工具。仓库测试命令为 npm test;默认 bootstrapMaxTokens 不设上限,如需首轮限制可在 tool-bootstrap 行中显式配置。
这个 Agent 与同类方案有什么区别?
相较官方 Minimal,基础 Anchored Standard 只在首轮保持 Minimal 的真实双工具 schema,随后恢复上下文并通过发现工具扩展能力;官方 Minimal 若永久使用则会放弃 Standard 的较宽工具面。相较一次性暴露完整 Standard 目录,本项目采用小型常驻目录,因为仓库记录完整目录晋级会使轨迹重新呈现 standard-like 行为。README 还列出 dsh-routing-suite 作为任务感知思考模式路由方案,以及 J-Space Cognition Suite V3.6 作为模型无关的推理时认知控制层;维护者仅转述用户在部分场景中报告它们表现更好,并未给出直接统一基准。