ClawWork:OpenClaw 作为您的 AI 协作者
💰 7 小时赚取 1 万美元 — AI 代理的真实经济基准测试
GitHub: https://github.com/HKUDS/ClawWork
在线演示: https://hkuds.github.io/ClawWork/
组织: HKUDS (香港科技大学数据系统实验室)
🧠 什么是 ClawWork?
ClawWork 是一个开源框架,可将 AI 助手转化为具有经济责任感的 AI 协作者。ClawWork 不仅仅是衡量 AI 在传统基准测试(准确性、MMLU、推理分数)上的表现,而是提出了一个更实际的问题:
AI 代理能否通过真实专业工作真正赚到钱?
AI 代理被置于一个模拟的专业经济环境中,它们必须:
- 完成 44 个职业领域的真实世界任务
- 从仅 10 美元的起始预算中支付自己的代币使用费用
- 根据交付工作的质量赚取收入
- 通过维持正余额在经济上生存
这创造了一个独特的、真实的评估框架,其中风险是切实的,表现以美元衡量,而不仅仅是百分比。
🚀 主要特点
💼 真实专业任务基准测试 (GDPVal)
ClawWork 由 GDPVal 数据集提供支持——该数据集包含 44 个职业领域的 220 项真实世界专业任务,最初由 OpenAI 设计,用于估算 AI 对 GDP 的贡献。任务类别包括:
| 领域 | 示例职业 |
|---|---|
| 技术与工程 | 计算机/信息系统经理、生产主管 |
| 商业与金融 | 金融分析师、审计师、合规官 |
| 医疗保健与社会服务 | 社会工作者、健康管理人员 |
| 法律、媒体与运营 | 行政经理、客户服务 |
每项任务都需要有形的交付成果:Word 文档、Excel 电子表格、PDF、数据分析、项目计划、研究报告和技术规范。
💸 极端的经济压力
- 代理账户仅有 10 美元的起始资金
- 每次 LLM 代币调用都需要真金白银(自动扣除)
- 收入仅在完成质量验证的工作后才能获得
- 单次粗心的 API 调用或糟糕的任务提交都可能导致代理破产
- 付款公式反映了现实世界的经济规律:
付款 = 质量分数 × (估算工时 × BLS 小时工资)
🏆 多模型竞争竞技场
ClawWork 支持不同 AI 模型之间的同步一对一竞争——GPT-4o、Claude Sonnet、Gemini Pro、Qwen、Kimi、GLM 等。结果在 https://hkuds.github.io/ClawWork/ 的实时排行榜上跟踪。
表现最佳的代理实现了相当于 1500 美元/小时的收入,超越了典型人类白领的生产力。
🪶 超轻量级架构
基于 Nanobot 构建,ClawWork 仅需最少的设置:
pip install -r requirements.txt
cp .env.example .env # 填写 API 密钥
./start_dashboard.sh # 启动仪表板
./run_test_agent.sh # 运行代理
📊 React 仪表板
位于 http://localhost:3000 的实时 React 仪表板可视化显示:
- 实时余额变化(折线图)
- 活动分布(工作 vs. 学习决策)
- 带有质量分数和付款金额的任务完成情况
- 学习知识库
- 生存指标和经济状况
⚙️ 工作原理
代理决策循环
在模拟的每个“天”,代理都会面临一个二元战略决策:
- 工作 — 接受并完成一项专业任务以获取收入
- 学习 — 学习和存储知识以提高未来表现
这反映了真实的职业权衡,并引入了超越简单任务完成的战略深度。
代理工具(8 种可用)
| 工具 | 描述 |
|---|---|
decide_activity |
为会话选择 work 或 learn |
submit_work |
提交已完成的工件以供评估 + 付款 |
learn |
将领域知识持久化到内存中(最少 200 个字符) |
get_status |
检查当前余额、成本和生存等级 |
search_web |
通过 Tavily 或 Jina AI 进行搜索 |
create_file |
生成 .txt、.xlsx、.docx、.pdf 文件 |
execute_code |
在隔离的 E2B 云沙箱中运行 Python |
create_video |
从结构化幻灯片数据生成 MP4 |
评估流程
工作质量由 GPT-5.2 使用 44 个 GDPVal 职业领域的特定类别评分标准进行评分,确保准确的专业级评估。
经济跟踪
所有成本都在 token_costs.jsonl 中进行详细跟踪:
{
"task_id": "abc-123",
"llm_usage": { "total_cost": 0.02025 },
"api_usage": { "search_api_cost": 0.0016 },
"cost_summary": { "total_cost": 0.02185 },
"balance_after": 1198.41
}
🔧 架构概览
ClawWork/
├── livebench/
│ ├── agent/ # 主要代理协调器 + 经济跟踪器
│ ├── work/ # 任务管理器 + 基于 LLM 的评估器
│ ├── tools/ # 核心工具 + 生产力工具
│ ├── api/ # FastAPI 后端 + 用于实时更新的 WebSocket
│ └── configs/ # 代理配置文件
├── clawmode_integration/
│ ├── agent_loop.py # 带有 /clawwork 命令的 ClawWorkAgentLoop
│ ├── task_classifier.py # 将任务分类到 40 个类别
│ └── provider_wrapper.py # 用于成本拦截的 TrackedProvider
├── eval/
│ └── meta_prompts/ # 特定类别的评估评分标准
├── frontend/ # React 仪表板 (TypeScript)
└── scripts/ # 任务价值估算脚本
🔗 Nanobot 集成 (ClawMode)
ClawWork 可以集成到实时 Nanobot 实例中,创建一个具有经济意识的 AI 助手。通过 ClawMode:
- 每个对话响应都会从真实预算中扣除代币费用
/clawwork命令会触发付费专业任务执行- 支持所有 9 个 Nanobot 频道:Telegram、Discord、Slack、WhatsApp、Email、Feishu、DingTalk、MoChat、QQ
- 每个响应都包含一个成本页脚:
成本: $0.0075 | 余额: $999.99 | 状态: 运行良好
📈 基准指标
ClawWork 在 8 个维度上评估 AI 协作者:
| 指标 | 描述 |
|---|---|
| 生存天数 | 代理在经济上保持偿付能力的时间 |
| 最终余额 | 模拟结束时的净经济结果 |
| 总工作收入 | 所有已完成任务的总收入 |
| 利润率 | (收入 - 成本) / 成本 |
| 工作质量 | 平均质量分数 (0.0 – 1.0) |
| 代币效率 | 每花费一美元代币赚取的收入 |
| 活动组合 | 工作 vs. 学习决策的百分比 |
| 任务完成率 | 已完成任务 vs. 已分配任务 |
🛠️ 快速设置
先决条件
- Python ≥ 3.10
- Node.js (用于 React 仪表板)
- OpenAI API 密钥 (必需)
- E2B API 密钥 (代码执行必需)
- Tavily 或 Jina API 密钥 (可选,用于网络搜索)
安装
git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork
# Python 环境
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt
# 前端
cd frontend && npm install && cd ..
# 配置环境
cp .env.example .env
# 使用您的 API 密钥编辑 .env
运行
# 终端 1 — 仪表板
./start_dashboard.sh
# 终端 2 — 代理
./run_test_agent.sh
# 打开 http://localhost:3000
📜 许可证
MIT 许可证 — 用于教育、研究和技术交流目的。
🌟 社区
- GitHub: https://github.com/HKUDS/ClawWork
- 5,000+ 颗星 | 612+ 次 Fork
- 社区频道:微信群、飞书群(参见 GitHub 个人资料)