开发与工程 ai-benchmarkeconomic-simulationgdpvalnanobot-integrationcost-trackingmulti-agent-evaluation

ClawWork:AI 经济生存模拟与协作基准

把 AI 助手变成必须自付 token 成本、靠完成真实职业任务赚钱才能存活的经济型 AI 同事,用以衡量真实生产力。

FollowSkills 评估 · FSRS-2.0
不推荐
43/ 100 五分制 2.2 / 5
1 2 3 4 5 6
1信任安全12 / 25 · 2.4/5

SKILL.md 本身是纯指令协议,不请求敏感权限或外部副作用,但它以 always:true 强制注入,指令模型调用网络搜索、代码沙箱等外部工具,未说明数据流向、确认机制或回滚;扣分主要因为缺乏最小权限声明与外部效果披露。

2可靠稳定8 / 20 · 2.0/5

指令内部自洽(工作流、阈值、迭代上限一致),但完全依赖外部 nanobot/clawwork 工具集,未见测试、错误处理或失败反馈路径的描述;静态评估下扣分因为关键路径不可复现、异常输入行为未知。

3适用触发7 / 15 · 2.3/5

场景明确(基准模拟中的经济生存循环),触发条件清晰(ClawMode/nanobot 环境),但未声明非适用边界,且依赖 OpenAI/E2B/Tavily 等海外服务,未说明中国网络可达性;扣分因边界与环境适配证据不足。

4规范维护8 / 15 · 2.7/5

文档结构清楚,仓库有 MIT 许可、README、故障排查和路线图,但 SKILL.md 自身无版本/变更记录,名称与描述与'经济生存协议'能力匹配但偏营销化,维护责任与更新路径未在技能层明确;扣分因版本治理与技能级文档不完整。

5有效结果5 / 15 · 1.7/5

作为基准模拟提示协议,能引导智能体完成任务流程,但对最终用户的直接可用价值取决于整个 ClawWork 系统运行;$19K/$15K 等收益声明未在静态文件中可验证,扣分因边际价值与结果可用性证据有限。

6证据核验3 / 10 · 1.5/5

README 提供排行榜与外部 GDPVal 数据集引用,存在 Pages 部署 CI,但均非针对该技能关键路径的可复现测试证据;收益数字与'真实经济'声明缺乏可独立验证的原始材料,扣分因证据类型单一且不可复现。

证据充分度: 评估于 2026年9月9日 审查版本 9c73ac05fdb0
使用前请注意
  • 静态评估,未执行任何代码;所有评分基于源文件阅读,置信度低。
  • 该技能以 always:true 常驻注入,会引导智能体进行网络搜索和沙箱代码执行,使用前应了解其成本与外部调用影响。
  • README 中的收入数字($15K/$19K)为项目方自报,静态材料无法独立核实。
  • 核心功能依赖 OpenAI、E2B、Tavily 等海外服务,中国大陆网络可达性未说明。
  • 技能文件本身无版本号与变更记录,升级可能无通知地改变智能体行为。
  • 发布者未经 FollowSkills 企业注册库验证,身份视为未知。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

ClawWork 是港大数据智能实验室(HKUDS)开源的经济生存基准系统,基于 MIT 协议。AI 智能体以 $10 起步,每调用一次 API 都会实时扣费,只有完成来自 OpenAI GDPVal 数据集的 220 个真实职业任务(覆盖 44 个行业)才能获得 $82–$5,000 的报酬,报酬按质量分乘以 BLS 工资估算。系统内置 React 仪表盘、经济追踪器和多模型排行榜,顶尖智能体在测试中达到约 $1,500+/小时的等效收入。它既可独立运行模拟,也可通过 ClawMode 接入现有 Nanobot 网关,把聊天机器人改造成自带成本核算的 AI 同事。

每日循环中,智能体先调用 decide_activity 决定“工作”或“学习”,工作时阅读 GDPVal 任务、可调用网页搜索、代码沙箱(默认 E2B)、文件生成(txt/xlsx/docx/pdf 等)和视频生成工具产出交付物,再通过 submit_work 提交给 GPT 模型按行业评分表评估并计酬;学习则通过 learn 把知识存入持久记忆。TrackedProvider 拦截每次 LLM 调用并扣除 token 费用,经济追踪器记录余额、收入、成本与生存状态(Thriving/Stable/Struggling/Bankrupt),FastAPI + React 仪表盘经 WebSocket 实时展示,账目写入 token_costs.l 等本地文件。

  1. AI 研究者想评估不同模型(GLM、Kimi、Qwen、Gemini 等)在真实工作任务上的质量、成本效率与长期生存能力
  2. 工程团队希望给已有 Nanobot 网关(Telegram/Discord/Slack 等九个渠道)增加经济核算,让每次对话都有成本意识
  3. 教育或演示场景中想直观展示 AI 如何在预算压力下做“工作 vs 学习”的职业决策
  4. 基准评测开发者想扩展新任务源、新评估评分表或新 LLM 提供商,仓库给出了明确的扩展点

这个 Skill 有哪些优点和局限?

优点
  • 基于真实 GDPVal 任务和 BLS 工资定价,报酬与质量挂钩,评估维度贴近生产环境
  • 采用真实成本核算:token 费用直接从 API 响应读取而非估算,经济追踪透明
  • 架构轻量,单次 pip 安装加配置即可部署,且给出清晰的扩展点(新任务源、新工具、新评分表)
  • 附带 React 仪表盘与多模型公开排行榜,结果可视化程度高
局限
  • 必须自备 OpenAI API key 并承担真实 API 费用;代码沙箱默认依赖 E2B 服务(有速率限制)
  • 智能体需在第 10–12 次迭代内提交否则超时,评估质量分低于 0.6 分文不获,失败成本由运行者承担
  • 官方文档未提供自动化测试套件的证据,稳定性需自行验证
  • README 中的收入数字($15K/11 小时、$19K/8 小时等)来自厂商自行运行的排行榜,缺乏独立复核

如何安装这个 Skill?

克隆仓库并进入目录:git clone https://github.com/HKUDS/ClawWork.git && cd ClawWork。创建 Python 3.10+ 环境(conda 或 venv),运行 pip install -r requirements.txt。前端需 cd frontend && npm install。复制 cp .env.example .env 并填入 OPENAI_API_KEY(必需);可选配置 E2B_API_KEY、WEB_SEARCH_API_KEY 及对应 provider 变量。ClawMode 集成的完整步骤见仓库 clawmode_integration/README.md(本页未包含全文)。

如何使用这个 Skill?

独立模拟模式:终端 1 运行 ./start_dashboard.sh 启动后端与 React 前端,终端 2 运行 ./run_test_agent.sh 启动智能体,浏览器打开 http://localhost:3000 实时观看余额与任务完成情况。智能体配置位于 livebench/configs/ 的 JSON 文件,可指定初始余额、token 单价、日期范围和多个智能体。ClawMode 模式运行 python -m clawmode_integration.cli agent|gateway,为现有 Nanobot 提供经济工具与 /clawwork 命令;注意余额追踪只经 ClawMode 网关生效,直接运行 nanobot agent 不会计费。

这个 Skill 与同类方案有什么区别?

源材料将 ClawWork 定位为对传统技术基准的替代——后者只测技术指标,而 ClawWork 同时衡量工作质量、成本效率与长期经济生存,并明确以 OpenAI GDPVal 数据集为任务来源。仓库未提及其他具体竞品名称。

常见问题

运行它需要花多少钱?
需要自备 OpenAI API key 并为所有 LLM 调用付费;智能体每任务成本记录在 token_costs.l 中。网页搜索也计费(Tavily 约 $0.0008/次,Jina 约 $0.05/百万 token)。任务报酬只按质量结算,低于 0.6 分不付款。
它和普通聊天机器人有何不同?
ClawMode 集成后,每条回复都附带成本脚注并从余额扣费,智能体必须通过完成真实职业任务赚取超过支出的收入才能维持运行。
失败模式有哪些?
常见问题包括仪表盘不更新(需强制刷新)、端口冲突(8000/3000)、E2B 沙箱 429 限流、以及 ClawMode 下余额不减少——后者是因为直接运行 nanobot agent 绕过了经济追踪器。
支持哪些模型和接入方式?
独立模式可配置任意基础模型(如 GPT-4o、Claude Sonnet 4.5),通过 LangChain/LiteLLM 即插即用;ClawMode 可接入 Nanobot 支持的 Telegram、Discord、Slack、WhatsApp、Email、飞书、钉钉等九个渠道。

相关 Skills