PinchBench
用真实世界任务测试大模型作为 OpenClaw 编码代理的实际表现,并提供公开排行榜供横向对比。
技能文档透明列出依赖与上传行为,提供 --no-upload 可跳过外发;但默认运行即自动上传结果到外部排行榜,且需注册 API token,对数据外流缺乏显式确认与说明;未展示 benchmark.py 源码,无法核实最小权限;pyproject 含 fabric/paramiko(SSH 工具)但用途未披露,存在数据流不透明扣分。
SKILL.md 命令、参数与示例自洽,jq 查询示例可用;但核心脚本 benchmark.py、tasks/、scripts/run.sh 未在证据中提供,无法静态验证关键路径;仓库 CI 仅有 lint 工作流,无针对该技能的测试执行;SKILL.md 称 23 个任务而 README 称 53 个,存在文档矛盾扣分。
场景(评测模型、对比模型、提交排行榜)与触发条件在 description 中写明,任务清单清晰;但能力边界、不适配范围(如非 OpenClaw 环境)未声明;核心功能依赖 OpenClaw 与境外模型 API(OpenRouter/Anthropic 等),未说明中国大陆可达性与中文支持,环境适配证据不足扣分。
结构清晰:前置条件、快速开始、参数表、自定义任务模板、许可证(MIT)、版本号(2.0.0-rc1)、CI lint 与 release 工作流齐备;但无 changelog、无针对该技能的已提交测试集、任务数在 23/53 间不一致、维护责任仅凭 metadata.author 字段,治理信息部分缺失扣分。
目标明确(对 OpenClaw agent 做真实任务基准评测),输出为可直接用 jq 分析的 JSON,并提供转录存档;但无法静态验证结果正确性与可用性,提交至排行榜的价值依赖未验证的外部服务,代表性输出未获证实,扣分。
仓库含 lint CI、release 版本管理、pre-commit 配置等可审计的工程化证据,README 与 SKILL.md 相互印证命令接口;但无针对 benchmark.py 关键路径的已提交测试(.agents/skills 下的测试属另一技能),无第三方执行证据,排行榜结果来源声明明确但不可独立核验,扣分。
- 默认运行即自动上传基准结果至外部排行榜,且需注册 API token;注重数据外流的用户应使用 --no-upload 并审查上传内容。
- pyproject 依赖 fabric/paramiko(SSH 库)但文档未说明用途,建议运行前审查实际源码。
- SKILL.md 称 23 个任务而 README 称 53 个,文档存在不一致;核心脚本 benchmark.py 未随证据提供,静态评审无法验证可运行性。
- 依赖 OpenClaw 与境外模型 API(OpenRouter 等),中国大陆可达性未说明;无中文支持声明。
- 发布者身份未经 FollowSkills 核验,排行榜数据不可独立验证。
这个 Skill 能做什么,适合哪些场景?
PinchBench 是一个基准测试系统,评估大语言模型作为 OpenClaw 代理“大脑”的能力。它不依赖合成测试,而是让代理执行日历、邮件、研究、编码和多步骤工作流等真实任务,并以自动评分或 LLM 评审打分。该技能包含 23 个任务,结果以 JSON 保存,可上传至 pinchbench.com 的公开排行榜。由 kilo.ai 团队维护,MIT 许可证开源。
通过 benchmark.py(uv 运行)向 OpenClaw 代理下发 23 个分类任务(基础、效率、研究、写作、编码、分析、邮件、记忆等),自动收集代理的工具调用与执行结果,用 Python 检查或 LLM 评审进行评分,将结果保存为 JSON(含会话 transcript JSONL),并通过注册 API token 自动上传到公开排行榜。支持按套件或单个任务运行、多次运行取均值、超时倍率,以及自定义任务添加。
- 模型选型者:在为 OpenClaw 代理挑选模型前,先跑一套真实任务对比候选模型得分
- 模型厂商或研究者:将新模型接入 OpenClaw 并提交结果到官方排行榜以获取曝光
- OpenClaw 用户:用 task_sanity 和部分自动化任务快速验证自己的代理环境是否配置正常
- 基准测试贡献者:按 TASK_TEMPLATE.md 编写自定义任务,扩展评测覆盖面
- 调试者:通过保存的 JSONL 会话记录回溯代理在失败任务中的具体行为
这个 Skill 有哪些优点和局限?
- 任务面向真实场景(日程、邮件、编码、研究),而非孤立的合成能力测试
- 自动评分与 LLM 评审结合,兼顾客观指标与细腻评价
- 有公开排行榜,模型间横向对比直接可见
- 结果 JSON 与会话 transcript 完整落盘,便于事后分析
- 任务模板开放,社区可贡献新任务
- 依赖一个运行中的 OpenClaw 实例,没有 OpenClaw 环境则无法直接使用
- SKILL.md 版本为 2.0.0-rc1,说明尚未正式发布,可能存在不稳定
- 完整跑全部任务耗时较长,需依赖所选模型的 API 费用
- LLM 评审的评分一致性可能受评审模型影响
- README 提到仓库共含 53 个任务,而本技能 SKILL.md 仅含 23 个任务,两个口径不一致
如何安装这个 Skill?
克隆仓库:git clone https://github.com/pinchbench/skill.git && cd skill。前置条件:Python 3.10+、uv 包管理器、一个运行中的 OpenClaw 实例(即代理本身)。技能本体位于 SKILL.md;仓库为一个包含多个技能的 monorepo,但 SKILL.md 对应的 pinchbench 技能可直接使用。文档未说明其他安装位置或平台市场安装方式。
如何使用这个 Skill?
在技能目录下运行:uv run benchmark.py --model anthropic/claude-sonnet-4。常用变体:--suite automated-only 只跑自动化任务;--suite task_calendar,task_stock 跑指定任务;--no-upload 只保留本地结果。首次提交排行榜需先执行 uv run benchmark.py --register 获取 API token。结果默认写入 results/ 目录,可用 jq 查询:jq '{average: ([.tasks[].grading.mean] | add / length)}' results/*.。模型 ID 需带供应商前缀,OpenRouter 为默认路由。
这个 Skill 与同类方案有什么区别?
README 未直接点名具体竞品,但指出多数 LLM 基准测试“只测孤立能力”,PinchBench 的差异化在于测试工具调用、多步推理和真实任务产出。