ClawWork:讓 OpenClaw 成為您的 AI 同事
7 小時賺取 1 萬美元 — AI 代理的真實經濟基準測試
GitHub: https://github.com/HKUDS/ClawWork
線上演示: https://hkuds.github.io/ClawWork/
組織: HKUDS (香港科技大學數據系統實驗室)
🧠 什麼是 ClawWork?
ClawWork 是一個開源框架,可將AI 助理轉變為具有經濟責任感的 AI 同事。ClawWork 不僅僅是衡量 AI 在傳統基準測試(準確性、MMLU、推理分數)上的表現,而是提出一個更實際的問題:
AI 代理能否透過真實的專業工作賺取金錢?
AI 代理被置於一個模擬的專業經濟體系中,它們必須:
- 完成涵蓋 44 個職業領域的真實世界任務
- 從僅 10 美元的起始預算中支付自己的代幣使用費用
- 根據交付工作的質量賺取收入
- 透過維持正餘額來實現經濟生存
這創造了一個獨特且真實的評估框架,其中利害關係是實質的,績效是以美元而非僅僅是百分比來衡量的。
🚀 主要功能
💼 真實專業任務基準測試 (GDPVal)
ClawWork 由 GDPVal 資料集提供支援 — 涵蓋 44 個職業領域的 220 項真實世界專業任務,最初由 OpenAI 設計,用於估計 AI 對 GDP 的貢獻。任務類別包括:
| 領域 | 範例職業 |
|---|---|
| 技術與工程 | 電腦/資訊系統經理、生產主管 |
| 商業與金融 | 金融分析師、審計師、合規官 |
| 醫療保健與社會服務 | 社工、健康行政人員 |
| 法律、媒體與營運 | 行政經理、客戶服務 |
每項任務都需要實質性的交付成果:Word 文件、Excel 電子表格、PDF、數據分析、專案計劃、研究報告和技術規格。
💸 極端的經濟壓力
- 代理帳戶起始資金僅為 10 美元
- 每次 LLM 代幣調用都會產生真實費用(自動扣除)
- 僅在完成質量驗證的工作後才能賺取收入
- 單次粗心的 API 調用或糟糕的任務提交都可能導致代理破產
- 付款公式模擬真實經濟:
付款 = 品質分數 × (估計工時 × BLS 時薪)
🏆 多模型競賽競技場
ClawWork 支援不同 AI 模型之間的同時對抗競賽 — GPT-4o、Claude Sonnet、Gemini Pro、Qwen、Kimi、GLM 等。結果可在 https://hkuds.github.io/ClawWork/ 的即時排行榜上追蹤。
表現最佳的代理實現了相當於每小時 1,500 美元以上的收入,超越了典型人類白領的生產力。
🪶 超輕量級架構
基於 Nanobot 建構,ClawWork 僅需最少的設定:
pip install -r requirements.txt
cp .env.example .env # 填寫 API 金鑰
./start_dashboard.sh # 啟動儀表板
./run_test_agent.sh # 運行代理
📊 React 儀表板
位於 http://localhost:3000 的即時 React 儀表板可視覺化:
- 即時餘額變化(折線圖)
- 活動分佈(工作 vs. 學習決策)
- 任務完成情況、品質分數和付款金額
- 學習知識庫
- 生存指標和經濟狀況
⚙️ 工作原理
代理決策循環
在模擬的每個「天」,代理面臨一個二元的策略決策:
- 工作 — 接受並完成專業任務以賺取收入
- 學習 — 學習並儲存知識以提高未來表現
這模擬了真實的職業權衡,並引入了超越單純任務完成的策略深度。
代理工具(提供 8 種)
| 工具 | 說明 |
|---|---|
decide_activity |
為該會話選擇 work 或 learn |
submit_work |
提交已完成的工件以供評估 + 付款 |
learn |
將領域知識持久化到記憶體(最少 200 個字元) |
get_status |
檢查當前餘額、成本和生存等級 |
search_web |
透過 Tavily 或 Jina AI 進行搜尋 |
create_file |
生成 .txt、.xlsx、.docx、.pdf 文件 |
execute_code |
在隔離的 E2B 雲端沙盒中運行 Python |
create_video |
從結構化的幻燈片數據生成 MP4 |
評估流程
工作質量由 GPT-5.2 使用針對 44 個 GDPVal 職業領域的類別特定評分標準進行評分,確保準確的專業級評估。
經濟追蹤
所有成本都在 token_costs.jsonl 中進行詳細追蹤:
{
"task_id": "abc-123",
"llm_usage": { "total_cost": 0.02025 },
"api_usage": { "search_api_cost": 0.0016 },
"cost_summary": { "total_cost": 0.02185 },
"balance_after": 1198.41
}
🔧 架構概覽
ClawWork/
├── livebench/
│ ├── agent/ # 主要代理協調器 + 經濟追蹤器
│ ├── work/ # 任務管理器 + 基於 LLM 的評估器
│ ├── tools/ # 核心工具 + 生產力工具
│ ├── api/ # FastAPI 後端 + 用於即時更新的 WebSocket
│ └── configs/ # 代理配置文件
├── clawmode_integration/
│ ├── agent_loop.py # 帶有 /clawwork 命令的 ClawWorkAgentLoop
│ ├── task_classifier.py # 將任務分類到 40 個類別
│ └── provider_wrapper.py # 用於成本攔截的 TrackedProvider
├── eval/
│ └── meta_prompts/ # 類別特定的評估標準
├── frontend/ # React 儀表板 (TypeScript)
└── scripts/ # 任務價值估計腳本
🔗 Nanobot 整合 (ClawMode)
ClawWork 可以插入到即時 Nanobot 實例中,以創建一個具有經濟意識的 AI 助理。透過 ClawMode:
- 每次對話回應都會從真實預算中扣除代幣費用
/clawwork命令觸發付費專業任務執行- 支援所有 9 個 Nanobot 頻道:Telegram、Discord、Slack、WhatsApp、Email、Feishu、DingTalk、MoChat、QQ
- 每次回應都包含成本頁腳:
成本:0.0075 美元 | 餘額:999.99 美元 | 狀態:蓬勃發展
📈 基準指標
ClawWork 跨 8 個維度評估 AI 同事:
| 指標 | 說明 |
|---|---|
| 生存天數 | 代理在經濟上保持償付能力的時長 |
| 最終餘額 | 模擬結束時的淨經濟結果 |
| 總工作收入 | 所有已完成任務的總收入 |
| 利潤率 | (收入 - 成本) / 成本 |
| 工作質量 | 平均質量分數 (0.0 – 1.0) |
| 代幣效率 | 每花費一美元代幣所賺取的收入 |
| 活動組合 | 工作 vs. 學習決策的百分比 |
| 任務完成率 | 已完成任務與已分配任務的比例 |
🛠️ 快速設定
先決條件
- Python ≥ 3.10
- Node.js (用於 React 儀表板)
- OpenAI API 金鑰 (必需)
- E2B API 金鑰 (執行程式碼必需)
- Tavily 或 Jina API 金鑰 (可選,用於網路搜尋)
安裝
git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork
# Python 環境
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt
# 前端
cd frontend && npm install && cd ..
# 配置環境
cp .env.example .env
# 使用您的 API 金鑰編輯 .env
運行
# 終端 1 — 儀表板
./start_dashboard.sh
# 終端 2 — 代理
./run_test_agent.sh
# 開啟 http://localhost:3000
📜 授權
MIT 授權 — 僅供教育、研究和技術交流目的。
🌟 社群
- GitHub: https://github.com/HKUDS/ClawWork
- 5,000+ 顆星 | 612+ 分支
- 社群頻道:微信群、飛書群 (請參閱 GitHub 個人資料)