PinchBench 智能体基准测试
用 53 个真实任务衡量大模型作为 OpenClaw 编码智能体的实际表现。
- Star 数
- ★ 1.4k
- 最近更新
- 3 个月前
- License
- MIT
- 主语言
- Python
- FA 评分
- 42/100 · 缺口较多
30 秒速览
- 运行形态
- 可在哪里用
- 兼容但需适配OpenAI API · Claude API
- 费用
- 软件免费,模型调用费用自付
- 上手难度
- 中 · 需要几步配置
- 开始前需要
- 典型场景
- 想评估某个模型在真实编码智能体场景下工具调用与多步推理能力的研究者或工程团队
- 不适合
- 不想部署并运行 OpenClaw 实例的用户
- 只想看排行榜结果、不打算自己跑任务的读者
这个 Agent 能做什么,适合哪些场景?
PinchBench 是一套面向 AI 编码智能体的真实任务基准测试系统,衡量的是模型作为 OpenClaw 智能体“大脑”时的表现,而不是孤立的合成能力测试。仓库本身包含基准技能与任务集合,官方排行榜位于 pinchbench.com,二者是分开的。任务划分为 Productivity、Research、Writing、Coding、Analysis、Email、Memory、Skills 八大类,共 53 个,每个任务通过自动判定、LLM judge 或两者结合评分。运行由 ./scripts/run.sh 驱动,需要 Python 3.10+、uv 包管理器以及一个运行中的 OpenClaw 实例。结果既可以只保存在本地 results/ 目录,也可以注册 API token 后自动上传到排行榜;标记为 official 的提交需要额外的 official key。任务会话记录会以 JSONL 形式保存在 results/{run_id}_transcripts/ 中,便于事后分析。
PinchBench 读取 tasks/ 下的任务定义,按类别(日历安排、股票查询、会议检索、博客写作、天气脚本、电子表格与 PDF 分析、邮件分诊、记忆检索、ClawHub 技能发现等)组织测试用例。执行入口是 ./scripts/run.sh:它接受 --model、--judge、--suite、--runs、--timeout-multiplier、--thinking、--output-dir、--no-upload、--register、--upload、--official-key 等参数,把模型接入 OpenClaw 智能体会话中,让它调用工具、多步推理并真正产出文件、邮件或日程。每个任务结束后由自动判定、由 judge 模型评定,或两者并行;未指定 --judge 时 judge 以 OpenClaw 智能体会话方式运行,指定后则直连模型 API(OpenRouter、Kilo Gateway、Anthropic、OpenAI 或本地 claude CLI),绕过 OpenClaw 的人格注入。结果写入 results/ JSON,并在提供 token 时上传至 pinchbench.com 排行榜;会话转录同步落盘为 JSONL。
- 想评估某个模型在真实编码智能体场景下工具调用与多步推理能力的研究者或工程团队
- 需要为自家模型在公开排行榜上提交成绩、并区分普通提交与 official 提交的厂商
- 准备为 OpenClaw 智能体挑选主力模型、希望用真实任务而非合成题做对比的开发者
- 想通过 ./scripts/run.sh --suite 只跑日历、股票等特定任务做局部回归验证的团队
- 希望参考 tasks/TASK_TEMPLATE.md 提交新任务、扩展基准覆盖面的贡献者
- 需要通过 results/{run_id}_transcripts/ 的 JSONL 转录复盘智能体每一步行为与失败原因的调试者
如何安装或部署这个 Agent?
前置条件:Python 3.10+、uv 包管理器,以及一个正在运行的 OpenClaw 实例。克隆仓库后即可使用脚本,仓库未提供额外的 pip/uv 安装步骤。
git clone https://github.com/pinchbench/skill.git
cd skill使用 OpenRouter 作为默认路由时需要配置 API 密钥;指定 --judge 直连某个厂商时,需按 judge 模型前缀准备对应环境变量(OPENROUTER_API_KEY、KILO_API_KEY、ANTHROPIC_API_KEY 或 OPENAI_API_KEY)。
如何使用这个 Agent?
用指定模型跑完整套件,模型 ID 必须带服务商前缀:
./scripts/run.sh --model openrouter/anthropic/claude-sonnet-4只跑特定任务,或为慢模型放大超时、多次运行取平均:
./scripts/run.sh --model openrouter/openai/gpt-4o --suite task_calendar,task_stock
./scripts/run.sh --model openrouter/anthropic/claude-sonnet-4 --runs 3 --timeout-multiplier 2注册上传 token,让结果自动进入排行榜;只想本地留档时加 --no-upload:
./scripts/run.sh --register
./scripts/run.sh --model openrouter/anthropic/claude-sonnet-4
./scripts/run.sh --model openrouter/anthropic/claude-sonnet-4 --no-upload提交 official 成绩,或改用直连 API 的 judge:
export PINCHBENCH_OFFICIAL_KEY=your_official_key
./scripts/run.sh --model anthropic/claude-sonnet-4
./scripts/run.sh --model openai/gpt-4o --judge openrouter/anthropic/claude-sonnet-4-5
./scripts/run.sh --model openai/gpt-4o --judge claude这个 Agent 有哪些优点和局限?
- 以真实任务而非合成题评测:日历、邮件分诊、文件管理、PDF 与电子表格分析等 53 个任务覆盖八大类别
- 评分方式灵活:自动判定、LLM judge 或两者结合,未指定 --judge 时默认走 OpenClaw 会话,也可直连 OpenRouter、Kilo、Anthropic、OpenAI 或本地 claude CLI
- 模型可插拔,模型 ID 带服务商前缀即可切换,默认经 OpenRouter 路由
- 结果可本地留存或上传至 pinchbench.com 公开排行榜,并区分普通提交与 official 提交
- 每次运行自动保存 JSONL 会话转录,便于逐任务复盘智能体行为
- 有 TASK_TEMPLATE.md 与明确任务质量标准,便于社区贡献新任务
- 强依赖运行中的 OpenClaw 实例,没有该运行时无法执行评测
- 需要第三方模型 API 密钥并按其计费产生费用,不是零成本本地工具
- 仓库本身不是官方排行榜结果来源,官方结果需修改 pinchbench/scripts/default-models.yml
- judge 行为取决于所选模型与厂商,不同 judge 之间可比性需要自行控制
- 文档未给出独立安装包或容器镜像,环境准备依赖手工克隆与自备 Python/uv/OpenClaw
- 仓库未列出 Topics,也没有额外的仓库指导文件,元信息较少
这个 Agent 与同类方案有什么区别?
README 明确把自己与“测试孤立能力的多数 LLM 基准”对立起来,但未点名任何具体竞品,因此不做具名对比。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | 形态 / 费用 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|---|
| PinchBench 智能体基准测试 当前 | 42 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 1.4k | 3 个月前 | Python | OpenAI API · Claude API |
| amux 智能体控制平面 | 77 · 表现良好 | 自托管服务免费 + 模型费 | ★ 507 | 1 天前 | Rust | Codex · Claude Code |
| Multica — 多智能体任务协作平台 | 52 · 缺口较多 | 网页应用免费版 + 付费版 | ★ 52k | 今天 | Go | ChatGPT · Codex · Claude Code |
| CORE 个人 AI 操作系统 | 44 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 2k | 23 天前 | TypeScript | Codex · Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
README 说明结果默认自动上传到 pinchbench.com,并提供 --no-upload 与 --register 令牌机制,属于对上传行为的有限透明与用户控制,但未说明上传内容范围、令牌存储方式或数据保留策略,故 least_privilege/user_confirmation/data_flow_transparency 仅给 1。依赖为 pyyaml/fabric/paramiko 等常见包且带下限版本,但无锁文件或哈希校验,dependency_security 给 1。仓库未提供回滚或撤销已上传结果的机制,rollback 为 0。来源归属清晰(MIT、pinchbench.com、kilo.ai、OpenClaw 链接),source_attribution 给 2。
README 的命令、标志与 pyproject 的入口点大体自洽,但 README 引用 SKILL.md 作为 readme 而该文件未在证据中提供,且 .agents/skills/building-dashboards 下的测试与 PinchBench 基准主题不一致,存在仓库内容混杂,self_consistency 给 1。依赖均为公开 PyPI 包,可用性可预期,但无版本锁定,dependency_availability 给 1。测试脚本有 pass/fail 输出与退出码,但主基准脚本的失败信息未在证据中展示,failure_messages 给 1。
README 明确面向评估 LLM 作为 OpenClaw 编码代理的场景,列出 8 类 53 个任务,audience_and_scenarios 给 2。能力边界部分说明(需 OpenClaw 实例、Python 3.10+、uv),但未说明不支持的环境或模型范围,capability_boundaries 给 1。触发方式依赖命令行标志,无自然语言触发精度说明,trigger_precision 给 1。环境适配要求运行中的 OpenClaw 与多种 API key,属较窄的专用环境,environment_fit 给 1。
README 结构清晰,含快速开始、命令参考、任务分类、贡献指南,information_architecture 给 2。安装步骤具体(git clone、uv、Python 版本、API key),install_notes 给 2。命名总体一致但仓库同时包含 PinchBench 基准与 building-dashboards 技能,命名稳定性与主题一致性不足,naming_stability 给 1。示例与命令示例丰富,examples_and_faq 给 2。已知限制仅零散提及(非官方排行榜来源、需 OpenClaw),known_limitations 给 1。LICENSE 为完整 MIT 文本,license 给 3。release.yml 会写入 BENCHMARK_VERSION,但无 CHANGELOG,versioning_changelog 给 1。维护责任指向 pinchbench 组织与 issues 链接,但发布者身份未验证,maintenance_responsibility 给 1。
输出为结果 JSON 与 JSONL 转录,便于后续分析,output_usability 给 2。作为基准系统对评估代理模型有实际价值,但仓库混杂无关技能、且官方结果需另仓库修改,marginal_value 给 1。运行需 OpenClaw 实例、模型 API 费用与多次运行,成本较高而收益依赖外部排行榜,cost_benefit 给 1。
README 的多数主张(任务数、类别、命令)可在仓库内部分对应,但 53 任务、评分方式等关键主张未在证据中给出可核验文件,claim_traceability 给 1。README、pyproject、workflow 之间部分互相印证,但缺少任务定义与评分代码,cross_source_corroboration 给 1。文档中事实陈述与营销性描述(如“real-world”“Claw-some”)混排,未明确区分推断与事实,fact_inference_separation 给 1。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 结果默认上传到 pinchbench.com,但未说明上传内容、令牌存储与数据保留策略;处理敏感任务转录前应使用 --no-upload 并审查上传范围。
- 仓库同时包含 PinchBench 基准与 .agents/skills/building-dashboards 技能,主题混杂,评估时需确认实际交付物边界。
- README 引用的 SKILL.md 未在证据中提供,任务定义与评分代码缺失,无法静态核验 53 任务与评分主张。
- 依赖未锁定版本,无哈希校验,供应链风险需自行缓解。
- 发布者身份未经验证,维护责任与更新路径仅由 README 链接推断。