开发与工程 computer-usecodexdeepseek-harnessbenchmarkingloop-engineering

LongHorizon-Harness

为 Claude Code、Codex、OpenCode 和 DeepSeek Harness 提供长期运行循环,让 AI 代理跨桌面应用和终端持续工作数小时。

FollowAgents 评估 · FARS-2.1
谨慎使用
66/ 100 五分制 3.3 / 5
1 2 3 4 5 6
1信任安全19 / 29 · 3.3/5

证据显示:角色隔离(Manager/Executor/Auditor)和权限分级(read-only vs workspace-write)在README中有明确描述,且代码中通过配置实现。用户确认机制存在(Dashboard审批)。数据流透明性:README说明任务状态、日志存储位置,以及API密钥不写入配置文件。敏感数据处理:API密钥通过环境变量传递,不落盘。依赖安全:依赖列表简单,且CI检查lockfile来源。外部影响:明确要求用户授权OS权限,且默认不启用插件。回滚:有checkpoint和恢复机制。来源归属:MIT许可证,但发布者未验证。扣分原因:静态审查无法验证实际执行,且部分安全声明(如角色隔离)仅靠文档断言,未提供代码级证据。

2可靠稳定9 / 14 · 3.2/5

证据显示:README描述一致,配置参考详细,角色解析链清晰。依赖可用性:依赖列表明确,且CI构建验证。失败消息:doctor命令提供诊断,错误处理有测试覆盖。扣分原因:静态审查无法验证运行时可靠性,且部分失败场景(如VM exec失败)的测试仅覆盖单元层面。

3适用触发12 / 18 · 3.3/5

证据显示:目标用户明确(开发者),场景覆盖GUI/CLI/混合。能力边界:支持多种后端和模型,但明确说明DeepSeek Harness为预览版,功能受限。触发精度:通过CLI参数和配置文件精确控制。环境适配:支持macOS(已测试)和Windows(未充分测试),有doctor检查。扣分原因:环境适配声明基于文档,未提供跨平台测试证据。

4规范维护12 / 18 · 3.3/5

证据显示:README结构清晰,有目录和配置参考。安装说明详细,包括依赖和步骤。命名稳定:版本号明确,有changelog(News部分)。示例和FAQ:有快速开始和配置示例。已知限制:明确说明平台状态和DeepSeek限制。许可证:MIT。版本控制:有版本号和更新日志。维护责任:发布者未验证,但GitHub Actions显示发布流程。扣分原因:发布者身份未验证,且部分文档(如FAQ)缺失。

5有效结果9 / 13 · 3.5/5

证据显示:输出可用性:提供报告和回复。边际价值:声称显著提升基准性能。成本效益:支持不同模型组合以平衡成本。扣分原因:性能声明基于自报基准,静态审查无法验证。

6证据核验5 / 8 · 3.1/5

证据显示:README中的性能数据有具体数字和基准名称,但未提供原始数据或复现方法。跨来源佐证:有arXiv链接和Hugging Face排名,但未提供独立验证。事实与推断分离:README区分了事实(版本更新)和推断(性能提升)。扣分原因:性能声明缺乏可复现的实验细节,且arXiv链接可能不可靠(日期异常)。

证据充分度: 评估于 2026年9月3日 审查版本 a1dd93061497
使用前请注意
  • 发布者身份未验证,需谨慎对待其声明。
  • 性能提升声明基于自报基准,缺乏独立复现。
  • 静态审查无法验证实际运行时的安全性和可靠性。
  • DeepSeek Harness集成处于预览阶段,功能受限。
  • Windows支持未充分测试。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

LongHorizon-Harness 是一个循环工程系统,旨在将现有代理转变为长期运行的计算机使用系统。它围绕代理构建一个持久执行循环,通过规划、执行、验证、检查点或恢复的循环来确保任务完成。该系统支持多种代理后端,包括 Claude Code、Codex CLI、OpenCode 和 DeepSeek Harness(CLI 阶段),并允许为不同角色分配不同模型和代理。它提供 Web 工作台和命令行界面,支持 GUI 和 CLI 任务,并通过验证状态确保进度可追踪和可恢复。LongHorizon-Harness 已通过 WeaveBench、OSWorld 2.0 和 Terminal-Bench 2.1 等数百个任务进行基准测试,显著提升了任务完成率。

LongHorizon-Harness 接收一个目标,并将剩余工作分解为有界的步骤。每个循环中,Manager 角色从原始目标、已验证进度和失败证据中重建下一轮状态;Executor 角色在全新上下文中执行一步操作;Auditor 角色通过检查实际文件、用户界面、日志和测试来独立验证结果。验证通过的进度会保存为检查点,失败则记录为证据并进入下一轮。它通过 lh-harness run 命令行或 lh-harness web Web 工作台启动任务,支持 --agent 参数选择后端,并可配置 agentmodelmax_rounds 等参数。运行结果保存在 ./.lh-harness/runs/<run-id>/ 目录中,包含轨迹、审计报告和最终答复。

  1. 开发者需要对跨桌面应用和终端的长期复杂任务进行自动化,例如在浏览器中开始任务,然后在 CLI 中处理数据,最后在桌面软件中生成文档。
  2. 质量保证工程师希望独立验证代理操作结果,通过 Auditor 角色确保进度真实可靠。
  3. 希望利用多代理后端的组织,例如使用强大的模型进行规划和审计,同时使用更便宜的模型进行执行,以平衡质量和成本。
  4. 研究人员需复现论文中的基准测试结果,LongHorizon-Harness 提供 eval/ 目录下的冻结测试套件。
  5. 需要长时运行代理并确保进度可恢复的用户,利用检查点机制在上下文刷新或失败后继续任务。

这个 Agent 有哪些优点和局限?

优点
  • 支持多种代理后端(Claude Code、Codex、OpenCode、DeepSeek Harness),灵活配置角色。
  • 强大的验证和检查点机制,确保只有独立验证过的进度才成为任务状态,失败可恢复。
  • 在多个基准测试上显示显著性能提升(如 OSWorld 2.0 完成率提升 3 倍)。
局限
  • 目前仅在 macOS 上完全测试,Windows 支持未完全验证。
  • 需依赖外部代理运行时,如 Claude Code 或 Codex,可能涉及商业 API 成本。
  • GUI 插件需要手动授权,如在 macOS 上授予辅助功能和屏幕录制权限。

如何安装或部署这个 Agent?

安装前需确保有 Python 3.10 或更高版本,以及一个在 PATH 中的代理运行时:codexclaudeopencodedsh。建议使用 uv tool install lh-harnesspip install lh-harness 安装。如需 GUI 支持,还需安装 Node.js 20+,并运行 lh-harness plugin install codex-computer-use(Codex)或 open-computer-use(Claude Code 或两者)。然后进入项目目录运行 lh-harness init 生成配置。

如何使用这个 Agent?

在项目目录中使用命令行启动任务,例如:TASK="检查当前目录并概括文件" && lh-harness run --task "${TASK}" --agent codex。或通过浏览器启动工作台:lh-harness web --workspace-root .,在打开的界面中创建任务。运行进度会在控制台显示,并生成报告保存至 ./.lh-harness/runs/<run-id>/logs/report.json。可运行 lh-harness doctor 检查环境,确保代理 CLI、Node.js 和插件等就绪。

常见问题

运行 LongHorizon-Harness 需要哪些成本?
LongHorizon-Harness 本身免费且开源,但需要依赖如 Claude Code 或 Codex 等代理后端,可能产生相关 API 费用。此外,GUI 插件需要 Node.js 20+,且需在 macOS 上手动授予辅助功能和屏幕录制权限。
任务中途失败会怎样?
LongHorizon-Harness 有检查点机制。如果执行失败,会记录失败证据,并从上次验证的检查点继续任务,而不会丢失已完成的进度。
是否支持 Windows?
项目目前主要在 macOS 上测试,Windows 支持尚未完全验证。GUI 插件可能不支持或需额外配置。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents