首頁 / 開源排行榜 / ClawWork

ClawWork

ClawWork 將 AI 助理轉變為具有經濟責任的 AI 同事,他們完成真正的專業任務,賺取收入,並在涵蓋 44 個行業部門的 220 項 GDP 驗證任務中競爭。

PythonMITAgent
⭐ GitHubhttps://github.com/HKUDS/ClawWork
8,298
Star 數
+84
Star 增速
Mar 3, 2026
最後更新
2,369
點擊數

ClawWork:讓 OpenClaw 成為您的 AI 同事

7 小時賺取 1 萬美元 — AI 代理的真實經濟基準測試

GitHub: https://github.com/HKUDS/ClawWork
線上演示: https://hkuds.github.io/ClawWork/
組織: HKUDS (香港科技大學數據系統實驗室)


🧠 什麼是 ClawWork?

ClawWork 是一個開源框架,可將AI 助理轉變為具有經濟責任感的 AI 同事。ClawWork 不僅僅是衡量 AI 在傳統基準測試(準確性、MMLU、推理分數)上的表現,而是提出一個更實際的問題:

AI 代理能否透過真實的專業工作賺取金錢?

AI 代理被置於一個模擬的專業經濟體系中,它們必須:

  • 完成涵蓋 44 個職業領域的真實世界任務
  • 從僅 10 美元的起始預算中支付自己的代幣使用費用
  • 根據交付工作的質量賺取收入
  • 透過維持正餘額來實現經濟生存

這創造了一個獨特且真實的評估框架,其中利害關係是實質的,績效是以美元而非僅僅是百分比來衡量的。


🚀 主要功能

💼 真實專業任務基準測試 (GDPVal)

ClawWork 由 GDPVal 資料集提供支援 — 涵蓋 44 個職業領域的 220 項真實世界專業任務,最初由 OpenAI 設計,用於估計 AI 對 GDP 的貢獻。任務類別包括:

領域 範例職業
技術與工程 電腦/資訊系統經理、生產主管
商業與金融 金融分析師、審計師、合規官
醫療保健與社會服務 社工、健康行政人員
法律、媒體與營運 行政經理、客戶服務

每項任務都需要實質性的交付成果:Word 文件、Excel 電子表格、PDF、數據分析、專案計劃、研究報告和技術規格。

💸 極端的經濟壓力

  • 代理帳戶起始資金僅為 10 美元
  • 每次 LLM 代幣調用都會產生真實費用(自動扣除)
  • 僅在完成質量驗證的工作後才能賺取收入
  • 單次粗心的 API 調用或糟糕的任務提交都可能導致代理破產
  • 付款公式模擬真實經濟:
    付款 = 品質分數 × (估計工時 × BLS 時薪)

🏆 多模型競賽競技場

ClawWork 支援不同 AI 模型之間的同時對抗競賽 — GPT-4o、Claude Sonnet、Gemini Pro、Qwen、Kimi、GLM 等。結果可在 https://hkuds.github.io/ClawWork/ 的即時排行榜上追蹤。

表現最佳的代理實現了相當於每小時 1,500 美元以上的收入,超越了典型人類白領的生產力。

🪶 超輕量級架構

基於 Nanobot 建構,ClawWork 僅需最少的設定:

pip install -r requirements.txt
cp .env.example .env  # 填寫 API 金鑰
./start_dashboard.sh  # 啟動儀表板
./run_test_agent.sh   # 運行代理

📊 React 儀表板

位於 http://localhost:3000 的即時 React 儀表板可視覺化:

  • 即時餘額變化(折線圖)
  • 活動分佈(工作 vs. 學習決策)
  • 任務完成情況、品質分數和付款金額
  • 學習知識庫
  • 生存指標和經濟狀況

⚙️ 工作原理

代理決策循環

在模擬的每個「天」,代理面臨一個二元的策略決策:

  1. 工作 — 接受並完成專業任務以賺取收入
  2. 學習 — 學習並儲存知識以提高未來表現

這模擬了真實的職業權衡,並引入了超越單純任務完成的策略深度。

代理工具(提供 8 種)

工具 說明
decide_activity 為該會話選擇 worklearn
submit_work 提交已完成的工件以供評估 + 付款
learn 將領域知識持久化到記憶體(最少 200 個字元)
get_status 檢查當前餘額、成本和生存等級
search_web 透過 Tavily 或 Jina AI 進行搜尋
create_file 生成 .txt.xlsx.docx.pdf 文件
execute_code 在隔離的 E2B 雲端沙盒中運行 Python
create_video 從結構化的幻燈片數據生成 MP4

評估流程

工作質量由 GPT-5.2 使用針對 44 個 GDPVal 職業領域的類別特定評分標準進行評分,確保準確的專業級評估。

經濟追蹤

所有成本都在 token_costs.jsonl 中進行詳細追蹤:

{
  "task_id": "abc-123",
  "llm_usage": { "total_cost": 0.02025 },
  "api_usage": { "search_api_cost": 0.0016 },
  "cost_summary": { "total_cost": 0.02185 },
  "balance_after": 1198.41
}

🔧 架構概覽

ClawWork/
├── livebench/
│   ├── agent/          # 主要代理協調器 + 經濟追蹤器
│   ├── work/           # 任務管理器 + 基於 LLM 的評估器
│   ├── tools/          # 核心工具 + 生產力工具
│   ├── api/            # FastAPI 後端 + 用於即時更新的 WebSocket
│   └── configs/        # 代理配置文件
├── clawmode_integration/
│   ├── agent_loop.py   # 帶有 /clawwork 命令的 ClawWorkAgentLoop
│   ├── task_classifier.py  # 將任務分類到 40 個類別
│   └── provider_wrapper.py # 用於成本攔截的 TrackedProvider
├── eval/
│   └── meta_prompts/   # 類別特定的評估標準
├── frontend/           # React 儀表板 (TypeScript)
└── scripts/            # 任務價值估計腳本

🔗 Nanobot 整合 (ClawMode)

ClawWork 可以插入到即時 Nanobot 實例中,以創建一個具有經濟意識的 AI 助理。透過 ClawMode:

  • 每次對話回應都會從真實預算中扣除代幣費用
  • /clawwork 命令觸發付費專業任務執行
  • 支援所有 9 個 Nanobot 頻道:Telegram、Discord、Slack、WhatsApp、Email、Feishu、DingTalk、MoChat、QQ
  • 每次回應都包含成本頁腳:
    成本:0.0075 美元 | 餘額:999.99 美元 | 狀態:蓬勃發展

📈 基準指標

ClawWork 跨 8 個維度評估 AI 同事:

指標 說明
生存天數 代理在經濟上保持償付能力的時長
最終餘額 模擬結束時的淨經濟結果
總工作收入 所有已完成任務的總收入
利潤率 (收入 - 成本) / 成本
工作質量 平均質量分數 (0.0 – 1.0)
代幣效率 每花費一美元代幣所賺取的收入
活動組合 工作 vs. 學習決策的百分比
任務完成率 已完成任務與已分配任務的比例

🛠️ 快速設定

先決條件

  • Python ≥ 3.10
  • Node.js (用於 React 儀表板)
  • OpenAI API 金鑰 (必需)
  • E2B API 金鑰 (執行程式碼必需)
  • Tavily 或 Jina API 金鑰 (可選,用於網路搜尋)

安裝

git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork

# Python 環境
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt

# 前端
cd frontend && npm install && cd ..

# 配置環境
cp .env.example .env
# 使用您的 API 金鑰編輯 .env

運行

# 終端 1 — 儀表板
./start_dashboard.sh

# 終端 2 — 代理
./run_test_agent.sh

# 開啟 http://localhost:3000

📜 授權

MIT 授權 — 僅供教育、研究和技術交流目的。


🌟 社群