Meta-Harness
自动搜索并优化固定基础模型周边的任务专用执行框架。
README清楚归因论文、作者、独立社区项目及单独的制品仓库,LICENSE也给出明确版权与MIT条款,因此source_attribution满分。README只概括框架会决定存储、检索、展示什么,并称包装器应记录提议者交互,故data_flow_transparency仅有薄弱依据;未说明具体数据目的地、保留期或日志内容。命令和测试显示会执行评估并写入文件,因此external_effects略有体现,但没有效果清单或边界。材料未提供最小权限、敏感数据处理、依赖安全、关键操作确认或回滚机制,相关项不得分。未验证的发布者身份仅视为未知,没有据此推断恶意或安全性。
README对框架、两个参考实验、外部制品以及Claude Code提议者假设的描述基本自洽,所示验证器也与任务输出检查相符,因此self_consistency达到普通水平。安装仅给出uv sync及运行命令,没有展示锁定依赖、版本要求或离线/替代依赖策略,dependency_availability只能得薄分。所示测试把文件缺失或JSON错误静默转换为零奖励,没有诊断信息;README也只有泛化的报错邀请,因此failure_messages不得分。
研究用途、文本分类、Terminal-Bench 2及迁移到新领域的场景均被明确指出,受众与场景较清楚。材料说明优化对象是固定基础模型周围的harness,区分可复用框架、参考实验和单独制品,并指出默认提议者是Claude Code及更换所需包装器,因此能力边界处理适中。触发流程主要是让编码助手阅读ONBOARDING.md并进行对话,缺少精确进入条件、停止条件和选择规则,trigger_precision较薄。环境方面仅可见uv、Python、bash、Claude Code假设及测试中的绝对容器路径,缺少平台、版本和资源兼容矩阵,environment_fit有限。
README结构清晰,提供目录、快速开始、新领域接入、发布说明和引用,information_architecture充分。快速开始和子目录指引支持基本安装,但当前材料没有实际子目录说明、先决条件或故障排查,install_notes未满分。项目名、路径和AgentHarness入口看起来一致,但没有稳定性或兼容承诺,naming_stability为中等。两个运行示例和新领域流程有用,但没有FAQ,examples_and_faq为中等。README明确披露代码只是论文代码的清理版本,除确认能运行外未进一步测试,并披露Claude Code假设,known_limitations满分。MIT许可证完整,license满分。只有一段无版本号的Release Note,没有版本历史或变更日志,versioning_changelog薄弱。作者由引用和版权可识别,也邀请用户报告问题,但没有维护者角色、支持渠道、更新策略或承诺,maintenance_responsibility仅薄弱成立。
快速开始产生可运行实验流程,新领域流程预期产出domain_spec.md,示例验证器给出机器可读奖励,因此output_usability达到普通水平,但缺少完整输出模式和解释性反馈。自动搜索任务专用harness相较手工设计具有明确的潜在增量价值,并有两个不同参考场景,但所给材料没有呈现比较结果,marginal_value不能满分。README称子目录会提供预期运行时间,但这些内容未出现在证据中;没有API费用、计算资源、搜索预算或收益权衡,因此cost_benefit仅有薄弱支持。
主要主张可追溯到命名论文、具体参考目录、独立制品和引用信息,且所示测试给出精确预期输出,因此claim_traceability较好,但没有逐项将论文结果对应到代码。当前证据仅由README、许可证和很小的输出验证器组成,未提供论文正文、完整实现、依赖文件或更广泛测试来交叉印证,cross_source_corroboration较薄。README将论文代码、清理后的发布版本、独立社区实现和未来可能收录的项目分开表述,并坦率限定测试范围,因此事实与推断分离较好;不过框架效用等概括性主张在所给材料中仍缺少直接证明。
- 这是仅基于所给文件的静态审查;未执行代码、安装依赖或复现实验。
- 在处理真实或敏感数据前,应核实提议者交互日志会记录什么、发送到哪里、保留多久以及如何删除。
- 运行前应审查未提供的依赖清单和锁文件,并确认Claude Code及其他外部服务的权限、费用和网络行为。
- 所示验证器会把缺失或无效JSON静默记为零奖励,可能掩盖环境或实现故障。
- 仓库自述仅验证代码可以运行,不能据此推断论文结果、正确性、稳定性或生产适用性。
这个 Agent 能做什么,适合哪些场景?
Meta-Harness 是一个面向模型 harness 自动搜索的研究框架;这里的 harness 指固定基础模型之外、决定工作过程中存储、检索和展示哪些信息的代码。仓库提供可复用框架、面向新领域的引导流程,以及论文中的两个参考实验。文本分类实验探索记忆系统,Terminal-Bench 2.0 实验探索执行脚手架的演化。用户通过各实验子目录中的 Python 或 Bash 命令在本地运行搜索或评测,而新领域接入流程会先产出 domain_spec.md。论文最终优化出的 Terminal-Bench 2 harness 不在本仓库中,而位于单独的 artifact 仓库。
在文本分类路径中,用户进入 reference_examples/text_classification,以 uv 安装环境后运行 meta_harness.py;该实验针对文本分类任务搜索记忆系统。在 Terminal-Bench 2.0 路径中,scripts/run_eval.sh 接收 agents.baseline_kira:AgentHarness、评测范围、运行参数和任务标识,例如 extract-elf,并执行基线 harness 的冒烟评测。面向新领域时,用户让编码助手读取 ONBOARDING.md,通过对话整理实施细节并生成 domain_spec.md。现有示例使用 Claude Code 充当 proposer agent,并通过 claude_wrapper.py 记录 proposer 交互;切换 proposer 时需要改造相应 wrapper。
- 研究模型 harness 优化的团队,希望复现论文中的文本分类记忆系统搜索实验。
- 参与 Terminal-Bench 2.0 评测的研究人员,希望运行基线 AgentHarness 的单任务冒烟测试。
- 已有固定基础模型的开发者,希望探索存储、检索和上下文展示策略,而不训练模型本身。
- 准备将 Meta-Harness 引入新任务领域的团队,希望借助 ONBOARDING.md 形成具体的 domain_spec.md。
- 希望研究执行脚手架演化的智能体工程人员,需要一个包含参考实验的起点。
这个 Agent 有哪些优点和局限?
- 将优化对象明确放在固定模型周边的存储、检索和信息展示代码上,无需把模型训练作为前提。
- 同时提供文本分类记忆系统搜索和 Terminal-Bench 2.0 脚手架演化两个具体参考实验。
- 提供 ONBOARDING.md 驱动的新领域接入流程,并将实施方案落为 domain_spec.md。
- proposer 通过独立的 claude_wrapper.py 接入,为替换 proposer 保留了明确改造点。
- 发布说明明确表示代码仅验证过能够运行,尚未经过更广泛测试。
- 现有示例假定 Claude Code 作为 proposer;换用其他 proposer 必须自行改造 wrapper。
- README 未给出 Python 版本、操作系统范围、认证方法、成本或预期运行时间等完整部署信息。
- 论文中优化后的 Terminal-Bench 2 harness 位于另一个 artifact 仓库,本仓库并不包含该最终产物。
如何安装或部署这个 Agent?
需要本地 shell、Python、uv,以及现有示例所假定的 Claude Code proposer 环境。文本分类实验的已记录安装步骤是:
cd reference_examples/text_classification
uv syncTerminal-Bench 2.0 实验的安装步骤是:
cd reference_examples/terminal_bench_2
uv sync来源未说明受支持的 Python 版本、操作系统、Claude Code 的安装或认证方式,也未列出其他凭据要求;采用前需在相应子目录的配置中确认这些细节。
如何使用这个 Agent?
运行一次文本分类搜索:
cd reference_examples/text_classification
uv sync
uv run python meta_harness.py --iterations 1运行 Terminal-Bench 2.0 的 extract-elf 冒烟任务:
cd reference_examples/terminal_bench_2
uv sync
uv run bash scripts/run_eval.sh agents.baseline_kira:AgentHarness full 1 1 -i extract-elf接入新领域时,将 ONBOARDING.md 提供给编码助手并通过对话生成 domain_spec.md。若不用 Claude Code 作为 proposer,需要修改 reference_examples/text_classification/claude_wrapper.py 或 reference_examples/terminal_bench_2/claude_wrapper.py,并确保 wrapper 能清晰记录 proposer 交互。
这个 Agent 与同类方案有什么区别?
与训练或微调基础模型的路线不同,Meta-Harness 固定基础模型,搜索模型周边决定存储、检索和信息展示方式的 harness。仓库没有提供与其他具名框架的直接基准比较。