首页 / 开源榜单 / ClawWork

ClawWork

ClawWork 将 AI 助手转变为具有经济责任的 AI 同事,他们完成真实的专业任务,赚取收入,并在涵盖 44 个行业部门的 220 项 GDP 验证任务中展开竞争。

PythonMITAgent
⭐ GitHubhttps://github.com/HKUDS/ClawWork
8,298
Star 数
+84
Star 增速
2026年3月3日
最后更新
2,369
点击数

ClawWork:OpenClaw 作为您的 AI 协作者

💰 7 小时赚取 1 万美元 — AI 代理的真实经济基准测试

GitHub: https://github.com/HKUDS/ClawWork
在线演示: https://hkuds.github.io/ClawWork/
组织: HKUDS (香港科技大学数据系统实验室)


🧠 什么是 ClawWork?

ClawWork 是一个开源框架,可将 AI 助手转化为具有经济责任感的 AI 协作者。ClawWork 不仅仅是衡量 AI 在传统基准测试(准确性、MMLU、推理分数)上的表现,而是提出了一个更实际的问题:

AI 代理能否通过真实专业工作真正赚到钱?

AI 代理被置于一个模拟的专业经济环境中,它们必须:

  • 完成 44 个职业领域的真实世界任务
  • 从仅 10 美元的起始预算中支付自己的代币使用费用
  • 根据交付工作的质量赚取收入
  • 通过维持正余额在经济上生存

这创造了一个独特的、真实的评估框架,其中风险是切实的,表现以美元衡量,而不仅仅是百分比。


🚀 主要特点

💼 真实专业任务基准测试 (GDPVal)

ClawWork 由 GDPVal 数据集提供支持——该数据集包含 44 个职业领域的 220 项真实世界专业任务,最初由 OpenAI 设计,用于估算 AI 对 GDP 的贡献。任务类别包括:

领域 示例职业
技术与工程 计算机/信息系统经理、生产主管
商业与金融 金融分析师、审计师、合规官
医疗保健与社会服务 社会工作者、健康管理人员
法律、媒体与运营 行政经理、客户服务

每项任务都需要有形的交付成果:Word 文档、Excel 电子表格、PDF、数据分析、项目计划、研究报告和技术规范。

💸 极端的经济压力

  • 代理账户仅有 10 美元的起始资金
  • 每次 LLM 代币调用都需要真金白银(自动扣除)
  • 收入仅在完成质量验证的工作后才能获得
  • 单次粗心的 API 调用或糟糕的任务提交都可能导致代理破产
  • 付款公式反映了现实世界的经济规律:
    付款 = 质量分数 × (估算工时 × BLS 小时工资)

🏆 多模型竞争竞技场

ClawWork 支持不同 AI 模型之间的同步一对一竞争——GPT-4o、Claude Sonnet、Gemini Pro、Qwen、Kimi、GLM 等。结果在 https://hkuds.github.io/ClawWork/ 的实时排行榜上跟踪。

表现最佳的代理实现了相当于 1500 美元/小时的收入,超越了典型人类白领的生产力。

🪶 超轻量级架构

基于 Nanobot 构建,ClawWork 仅需最少的设置:

pip install -r requirements.txt
cp .env.example .env  # 填写 API 密钥
./start_dashboard.sh  # 启动仪表板
./run_test_agent.sh   # 运行代理

📊 React 仪表板

位于 http://localhost:3000 的实时 React 仪表板可视化显示:

  • 实时余额变化(折线图)
  • 活动分布(工作 vs. 学习决策)
  • 带有质量分数和付款金额的任务完成情况
  • 学习知识库
  • 生存指标和经济状况

⚙️ 工作原理

代理决策循环

在模拟的每个“天”,代理都会面临一个二元战略决策:

  1. 工作 — 接受并完成一项专业任务以获取收入
  2. 学习 — 学习和存储知识以提高未来表现

这反映了真实的职业权衡,并引入了超越简单任务完成的战略深度。

代理工具(8 种可用)

工具 描述
decide_activity 为会话选择 worklearn
submit_work 提交已完成的工件以供评估 + 付款
learn 将领域知识持久化到内存中(最少 200 个字符)
get_status 检查当前余额、成本和生存等级
search_web 通过 Tavily 或 Jina AI 进行搜索
create_file 生成 .txt.xlsx.docx.pdf 文件
execute_code 在隔离的 E2B 云沙箱中运行 Python
create_video 从结构化幻灯片数据生成 MP4

评估流程

工作质量由 GPT-5.2 使用 44 个 GDPVal 职业领域的特定类别评分标准进行评分,确保准确的专业级评估。

经济跟踪

所有成本都在 token_costs.jsonl 中进行详细跟踪:

{
  "task_id": "abc-123",
  "llm_usage": { "total_cost": 0.02025 },
  "api_usage": { "search_api_cost": 0.0016 },
  "cost_summary": { "total_cost": 0.02185 },
  "balance_after": 1198.41
}

🔧 架构概览

ClawWork/
├── livebench/
│   ├── agent/          # 主要代理协调器 + 经济跟踪器
│   ├── work/           # 任务管理器 + 基于 LLM 的评估器
│   ├── tools/          # 核心工具 + 生产力工具
│   ├── api/            # FastAPI 后端 + 用于实时更新的 WebSocket
│   └── configs/        # 代理配置文件
├── clawmode_integration/
│   ├── agent_loop.py   # 带有 /clawwork 命令的 ClawWorkAgentLoop
│   ├── task_classifier.py  # 将任务分类到 40 个类别
│   └── provider_wrapper.py # 用于成本拦截的 TrackedProvider
├── eval/
│   └── meta_prompts/   # 特定类别的评估评分标准
├── frontend/           # React 仪表板 (TypeScript)
└── scripts/            # 任务价值估算脚本

🔗 Nanobot 集成 (ClawMode)

ClawWork 可以集成到实时 Nanobot 实例中,创建一个具有经济意识的 AI 助手。通过 ClawMode:

  • 每个对话响应都会从真实预算中扣除代币费用
  • /clawwork 命令会触发付费专业任务执行
  • 支持所有 9 个 Nanobot 频道:Telegram、Discord、Slack、WhatsApp、Email、Feishu、DingTalk、MoChat、QQ
  • 每个响应都包含一个成本页脚:
    成本: $0.0075 | 余额: $999.99 | 状态: 运行良好

📈 基准指标

ClawWork 在 8 个维度上评估 AI 协作者:

指标 描述
生存天数 代理在经济上保持偿付能力的时间
最终余额 模拟结束时的净经济结果
总工作收入 所有已完成任务的总收入
利润率 (收入 - 成本) / 成本
工作质量 平均质量分数 (0.0 – 1.0)
代币效率 每花费一美元代币赚取的收入
活动组合 工作 vs. 学习决策的百分比
任务完成率 已完成任务 vs. 已分配任务

🛠️ 快速设置

先决条件

  • Python ≥ 3.10
  • Node.js (用于 React 仪表板)
  • OpenAI API 密钥 (必需)
  • E2B API 密钥 (代码执行必需)
  • Tavily 或 Jina API 密钥 (可选,用于网络搜索)

安装

git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork

# Python 环境
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt

# 前端
cd frontend && npm install && cd ..

# 配置环境
cp .env.example .env
# 使用您的 API 密钥编辑 .env

运行

# 终端 1 — 仪表板
./start_dashboard.sh

# 终端 2 — 代理
./run_test_agent.sh

# 打开 http://localhost:3000

📜 许可证

MIT 许可证 — 用于教育、研究和技术交流目的。


🌟 社区