开发与工程 benchmarkingllm-evaluationopenclawpythonleaderboardmodel-comparisonuv

PinchBench

用真实世界任务测试大模型作为 OpenClaw 编码代理的实际表现,并提供公开排行榜供横向对比。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
1 2 3 4 5 6
1信任安全12 / 25 · 2.4/5

技能文档透明列出依赖与上传行为,提供 --no-upload 可跳过外发;但默认运行即自动上传结果到外部排行榜,且需注册 API token,对数据外流缺乏显式确认与说明;未展示 benchmark.py 源码,无法核实最小权限;pyproject 含 fabric/paramiko(SSH 工具)但用途未披露,存在数据流不透明扣分。

2可靠稳定8 / 20 · 2.0/5

SKILL.md 命令、参数与示例自洽,jq 查询示例可用;但核心脚本 benchmark.py、tasks/、scripts/run.sh 未在证据中提供,无法静态验证关键路径;仓库 CI 仅有 lint 工作流,无针对该技能的测试执行;SKILL.md 称 23 个任务而 README 称 53 个,存在文档矛盾扣分。

3适用触发7 / 15 · 2.3/5

场景(评测模型、对比模型、提交排行榜)与触发条件在 description 中写明,任务清单清晰;但能力边界、不适配范围(如非 OpenClaw 环境)未声明;核心功能依赖 OpenClaw 与境外模型 API(OpenRouter/Anthropic 等),未说明中国大陆可达性与中文支持,环境适配证据不足扣分。

4规范维护9 / 15 · 3.0/5

结构清晰:前置条件、快速开始、参数表、自定义任务模板、许可证(MIT)、版本号(2.0.0-rc1)、CI lint 与 release 工作流齐备;但无 changelog、无针对该技能的已提交测试集、任务数在 23/53 间不一致、维护责任仅凭 metadata.author 字段,治理信息部分缺失扣分。

5有效结果5 / 15 · 1.7/5

目标明确(对 OpenClaw agent 做真实任务基准评测),输出为可直接用 jq 分析的 JSON,并提供转录存档;但无法静态验证结果正确性与可用性,提交至排行榜的价值依赖未验证的外部服务,代表性输出未获证实,扣分。

6证据核验3 / 10 · 1.5/5

仓库含 lint CI、release 版本管理、pre-commit 配置等可审计的工程化证据,README 与 SKILL.md 相互印证命令接口;但无针对 benchmark.py 关键路径的已提交测试(.agents/skills 下的测试属另一技能),无第三方执行证据,排行榜结果来源声明明确但不可独立核验,扣分。

证据充分度: 评估于 2026年9月9日 审查版本 819384ae8304
使用前请注意
  • 默认运行即自动上传基准结果至外部排行榜,且需注册 API token;注重数据外流的用户应使用 --no-upload 并审查上传内容。
  • pyproject 依赖 fabric/paramiko(SSH 库)但文档未说明用途,建议运行前审查实际源码。
  • SKILL.md 称 23 个任务而 README 称 53 个,文档存在不一致;核心脚本 benchmark.py 未随证据提供,静态评审无法验证可运行性。
  • 依赖 OpenClaw 与境外模型 API(OpenRouter 等),中国大陆可达性未说明;无中文支持声明。
  • 发布者身份未经 FollowSkills 核验,排行榜数据不可独立验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

PinchBench 是一个基准测试系统,评估大语言模型作为 OpenClaw 代理“大脑”的能力。它不依赖合成测试,而是让代理执行日历、邮件、研究、编码和多步骤工作流等真实任务,并以自动评分或 LLM 评审打分。该技能包含 23 个任务,结果以 JSON 保存,可上传至 pinchbench.com 的公开排行榜。由 kilo.ai 团队维护,MIT 许可证开源。

通过 benchmark.py(uv 运行)向 OpenClaw 代理下发 23 个分类任务(基础、效率、研究、写作、编码、分析、邮件、记忆等),自动收集代理的工具调用与执行结果,用 Python 检查或 LLM 评审进行评分,将结果保存为 JSON(含会话 transcript JSONL),并通过注册 API token 自动上传到公开排行榜。支持按套件或单个任务运行、多次运行取均值、超时倍率,以及自定义任务添加。

  1. 模型选型者:在为 OpenClaw 代理挑选模型前,先跑一套真实任务对比候选模型得分
  2. 模型厂商或研究者:将新模型接入 OpenClaw 并提交结果到官方排行榜以获取曝光
  3. OpenClaw 用户:用 task_sanity 和部分自动化任务快速验证自己的代理环境是否配置正常
  4. 基准测试贡献者:按 TASK_TEMPLATE.md 编写自定义任务,扩展评测覆盖面
  5. 调试者:通过保存的 JSONL 会话记录回溯代理在失败任务中的具体行为

这个 Skill 有哪些优点和局限?

优点
  • 任务面向真实场景(日程、邮件、编码、研究),而非孤立的合成能力测试
  • 自动评分与 LLM 评审结合,兼顾客观指标与细腻评价
  • 有公开排行榜,模型间横向对比直接可见
  • 结果 JSON 与会话 transcript 完整落盘,便于事后分析
  • 任务模板开放,社区可贡献新任务
局限
  • 依赖一个运行中的 OpenClaw 实例,没有 OpenClaw 环境则无法直接使用
  • SKILL.md 版本为 2.0.0-rc1,说明尚未正式发布,可能存在不稳定
  • 完整跑全部任务耗时较长,需依赖所选模型的 API 费用
  • LLM 评审的评分一致性可能受评审模型影响
  • README 提到仓库共含 53 个任务,而本技能 SKILL.md 仅含 23 个任务,两个口径不一致

如何安装这个 Skill?

克隆仓库:git clone https://github.com/pinchbench/skill.git && cd skill。前置条件:Python 3.10+、uv 包管理器、一个运行中的 OpenClaw 实例(即代理本身)。技能本体位于 SKILL.md;仓库为一个包含多个技能的 monorepo,但 SKILL.md 对应的 pinchbench 技能可直接使用。文档未说明其他安装位置或平台市场安装方式。

如何使用这个 Skill?

在技能目录下运行:uv run benchmark.py --model anthropic/claude-sonnet-4。常用变体:--suite automated-only 只跑自动化任务;--suite task_calendar,task_stock 跑指定任务;--no-upload 只保留本地结果。首次提交排行榜需先执行 uv run benchmark.py --register 获取 API token。结果默认写入 results/ 目录,可用 jq 查询:jq '{average: ([.tasks[].grading.mean] | add / length)}' results/*.。模型 ID 需带供应商前缀,OpenRouter 为默认路由。

这个 Skill 与同类方案有什么区别?

README 未直接点名具体竞品,但指出多数 LLM 基准测试“只测孤立能力”,PinchBench 的差异化在于测试工具调用、多步推理和真实任务产出。

常见问题

没有 OpenClaw 实例能用吗?
不能。该基准的前提就是把被测模型作为 OpenClaw 代理的大脑运行,前提条件明确要求一个运行中的 OpenClaw 实例。
需要什么 API 密钥?
被测模型需要对应供应商的密钥(如 OpenRouter、Anthropic、OpenAI、Kilo Gateway 的 API key),具体取决于模型 ID 前缀;若使用 --judge 直接调用评审模型 API,也需要相应密钥。提交排行榜另需通过 --register 注册 token。
能不能只跑部分任务或不上传结果?
可以。--suite 支持只跑自动化任务(automated-only)或逗号分隔的指定任务;--no-upload 跳过上传,结果仅保存在本地 results/ 目录。
任务太难或模型太慢怎么办?
可用 --timeout-multiplier 放大任务超时时间以适配较慢的模型,用 --runs 控制每任务运行次数取平均分。

同仓库的其他 Skills

均来自 pinchbench/skill

相关 Skills