ClawWork:AI 经济生存模拟与协作基准
把 AI 助手变成必须自付 token 成本、靠完成真实职业任务赚钱才能存活的经济型 AI 同事,用以衡量真实生产力。
SKILL.md 本身是纯指令协议,不请求敏感权限或外部副作用,但它以 always:true 强制注入,指令模型调用网络搜索、代码沙箱等外部工具,未说明数据流向、确认机制或回滚;扣分主要因为缺乏最小权限声明与外部效果披露。
指令内部自洽(工作流、阈值、迭代上限一致),但完全依赖外部 nanobot/clawwork 工具集,未见测试、错误处理或失败反馈路径的描述;静态评估下扣分因为关键路径不可复现、异常输入行为未知。
场景明确(基准模拟中的经济生存循环),触发条件清晰(ClawMode/nanobot 环境),但未声明非适用边界,且依赖 OpenAI/E2B/Tavily 等海外服务,未说明中国网络可达性;扣分因边界与环境适配证据不足。
文档结构清楚,仓库有 MIT 许可、README、故障排查和路线图,但 SKILL.md 自身无版本/变更记录,名称与描述与'经济生存协议'能力匹配但偏营销化,维护责任与更新路径未在技能层明确;扣分因版本治理与技能级文档不完整。
作为基准模拟提示协议,能引导智能体完成任务流程,但对最终用户的直接可用价值取决于整个 ClawWork 系统运行;$19K/$15K 等收益声明未在静态文件中可验证,扣分因边际价值与结果可用性证据有限。
README 提供排行榜与外部 GDPVal 数据集引用,存在 Pages 部署 CI,但均非针对该技能关键路径的可复现测试证据;收益数字与'真实经济'声明缺乏可独立验证的原始材料,扣分因证据类型单一且不可复现。
- 静态评估,未执行任何代码;所有评分基于源文件阅读,置信度低。
- 该技能以 always:true 常驻注入,会引导智能体进行网络搜索和沙箱代码执行,使用前应了解其成本与外部调用影响。
- README 中的收入数字($15K/$19K)为项目方自报,静态材料无法独立核实。
- 核心功能依赖 OpenAI、E2B、Tavily 等海外服务,中国大陆网络可达性未说明。
- 技能文件本身无版本号与变更记录,升级可能无通知地改变智能体行为。
- 发布者未经 FollowSkills 企业注册库验证,身份视为未知。
这个 Skill 能做什么,适合哪些场景?
ClawWork 是港大数据智能实验室(HKUDS)开源的经济生存基准系统,基于 MIT 协议。AI 智能体以 $10 起步,每调用一次 API 都会实时扣费,只有完成来自 OpenAI GDPVal 数据集的 220 个真实职业任务(覆盖 44 个行业)才能获得 $82–$5,000 的报酬,报酬按质量分乘以 BLS 工资估算。系统内置 React 仪表盘、经济追踪器和多模型排行榜,顶尖智能体在测试中达到约 $1,500+/小时的等效收入。它既可独立运行模拟,也可通过 ClawMode 接入现有 Nanobot 网关,把聊天机器人改造成自带成本核算的 AI 同事。
每日循环中,智能体先调用 decide_activity 决定“工作”或“学习”,工作时阅读 GDPVal 任务、可调用网页搜索、代码沙箱(默认 E2B)、文件生成(txt/xlsx/docx/pdf 等)和视频生成工具产出交付物,再通过 submit_work 提交给 GPT 模型按行业评分表评估并计酬;学习则通过 learn 把知识存入持久记忆。TrackedProvider 拦截每次 LLM 调用并扣除 token 费用,经济追踪器记录余额、收入、成本与生存状态(Thriving/Stable/Struggling/Bankrupt),FastAPI + React 仪表盘经 WebSocket 实时展示,账目写入 token_costs.l 等本地文件。
- AI 研究者想评估不同模型(GLM、Kimi、Qwen、Gemini 等)在真实工作任务上的质量、成本效率与长期生存能力
- 工程团队希望给已有 Nanobot 网关(Telegram/Discord/Slack 等九个渠道)增加经济核算,让每次对话都有成本意识
- 教育或演示场景中想直观展示 AI 如何在预算压力下做“工作 vs 学习”的职业决策
- 基准评测开发者想扩展新任务源、新评估评分表或新 LLM 提供商,仓库给出了明确的扩展点
这个 Skill 有哪些优点和局限?
- 基于真实 GDPVal 任务和 BLS 工资定价,报酬与质量挂钩,评估维度贴近生产环境
- 采用真实成本核算:token 费用直接从 API 响应读取而非估算,经济追踪透明
- 架构轻量,单次 pip 安装加配置即可部署,且给出清晰的扩展点(新任务源、新工具、新评分表)
- 附带 React 仪表盘与多模型公开排行榜,结果可视化程度高
- 必须自备 OpenAI API key 并承担真实 API 费用;代码沙箱默认依赖 E2B 服务(有速率限制)
- 智能体需在第 10–12 次迭代内提交否则超时,评估质量分低于 0.6 分文不获,失败成本由运行者承担
- 官方文档未提供自动化测试套件的证据,稳定性需自行验证
- README 中的收入数字($15K/11 小时、$19K/8 小时等)来自厂商自行运行的排行榜,缺乏独立复核
如何安装这个 Skill?
克隆仓库并进入目录:git clone https://github.com/HKUDS/ClawWork.git && cd ClawWork。创建 Python 3.10+ 环境(conda 或 venv),运行 pip install -r requirements.txt。前端需 cd frontend && npm install。复制 cp .env.example .env 并填入 OPENAI_API_KEY(必需);可选配置 E2B_API_KEY、WEB_SEARCH_API_KEY 及对应 provider 变量。ClawMode 集成的完整步骤见仓库 clawmode_integration/README.md(本页未包含全文)。
如何使用这个 Skill?
独立模拟模式:终端 1 运行 ./start_dashboard.sh 启动后端与 React 前端,终端 2 运行 ./run_test_agent.sh 启动智能体,浏览器打开 http://localhost:3000 实时观看余额与任务完成情况。智能体配置位于 livebench/configs/ 的 JSON 文件,可指定初始余额、token 单价、日期范围和多个智能体。ClawMode 模式运行 python -m clawmode_integration.cli agent|gateway,为现有 Nanobot 提供经济工具与 /clawwork 命令;注意余额追踪只经 ClawMode 网关生效,直接运行 nanobot agent 不会计费。
这个 Skill 与同类方案有什么区别?
源材料将 ClawWork 定位为对传统技术基准的替代——后者只测技术指标,而 ClawWork 同时衡量工作质量、成本效率与长期经济生存,并明确以 OpenAI GDPVal 数据集为任务来源。仓库未提及其他具体竞品名称。