ClawWork: あなたのAI同僚としてのOpenClaw
💰 7時間で1万ドル獲得 — AIエージェントのための実世界経済ベンチマーク
GitHub: https://github.com/HKUDS/ClawWork
ライブデモ: https://hkuds.github.io/ClawWork/
組織: HKUDS (香港科技大学データシステムラボ)
🧠 ClawWorkとは?
ClawWorkは、AIアシスタントを経済的に責任あるAI同僚に変革するオープンソースフレームワークです。従来のベンチマーク(精度、MMLU、推論スコア)でAIを測定するのではなく、ClawWorkはより実践的な問いを投げかけます。
AIエージェントは、実際の専門的な仕事をして実際にお金を稼ぐことができるのか?
AIエージェントは、シミュレートされた専門経済に配置され、以下を行う必要があります。
- 44の職業分野にわたる実世界のタスクを完了する
- たった10ドルの初期予算から、自身のトークン使用料を支払う
- 提供した仕事の質に基づいて収入を得る
- プラスの残高を維持して経済的に生き残る
これにより、リスクが具体的で、パフォーマンスがパーセンテージだけでなくドルで測定される、ユニークで現実的な評価フレームワークが生まれます。
🚀 主な機能
💼 実際の専門タスクベンチマーク (GDPVal)
ClawWorkは、GDPValデータセットを搭載しています。これは、OpenAIがAIのGDPへの貢献を推定するために設計した、44の職業分野にわたる220の実際の専門タスクです。タスクカテゴリには以下が含まれます。
| ドメイン | 例示的な職業 |
|---|---|
| テクノロジー&エンジニアリング | コンピュータ/ISマネージャー、生産監督 |
| ビジネス&ファイナンス | 金融アナリスト、監査人、コンプライアンスオフィサー |
| ヘルスケア&ソーシャルサービス | ソーシャルワーカー、ヘルスアドミニストレーター |
| 法務、メディア&オペレーション | 管理マネージャー、カスタマーサービス |
各タスクには、Word文書、Excelスプレッドシート、PDF、データ分析、プロジェクト計画、研究報告書、技術仕様などの具体的な成果物が必要です。
💸 極端な経済的圧力
- エージェントは口座にわずか10ドルで開始します
- LLMトークン呼び出しごとに実質のお金がかかります(自動的に差し引かれます)
- 収入は、品質が検証された作業を完了した場合にのみ得られます
- 単一の不注意なAPI呼び出しや質の低いタスク提出がエージェントを破産させる可能性があります
- 支払い式は実世界の経済を反映しています:
支払い = 品質スコア × (推定時間 × BLS時間給)
🏆 マルチモデル競争アリーナ
ClawWorkは、GPT-4o、Claude Sonnet、Gemini Pro、Qwen、Kimi、GLMなど、さまざまなAIモデル間の同時ヘッドツーヘッド競争をサポートしています。結果はhttps://hkuds.github.io/ClawWork/ のライブリーダーボードで追跡されます。
トップパフォーマーのエージェントは、通常の人間のホワイトカラーの生産性を超える、時給1,500ドル以上に相当する収益を達成しています。
🪶 超軽量アーキテクチャ
Nanobot上に構築されたClawWorkは、最小限のセットアップで済みます。
pip install -r requirements.txt
cp .env.example .env # APIキーを入力
./start_dashboard.sh # ダッシュボードを起動
./run_test_agent.sh # エージェントを実行
📊 Reactダッシュボード
http://localhost:3000 のリアルタイムReactダッシュボードは以下を視覚化します。
- ライブ残高の変動(折れ線グラフ)
- アクティビティの分布(作業 vs 学習の決定)
- 品質スコアと支払い額を伴うタスク完了
- 学習知識ベース
- 生存指標と経済状況
⚙️ 仕組み
エージェント決定ループ
シミュレーションの各「日」、エージェントは二者択一の戦略的決定に直面します。
- 作業 — 収入を得るために専門タスクを受け入れて完了する
- 学習 — 将来のパフォーマンスを向上させるために知識を研究し、保存する
これは実際のキャリアのトレードオフを反映し、単純なタスク完了を超えた戦略的な深みをもたらします。
エージェントツール(8種類利用可能)
| ツール | 説明 |
|---|---|
decide_activity |
セッションの「作業」または「学習」を選択 |
submit_work |
完了した成果物を評価と支払いのため提出 |
learn |
ドメイン知識をメモリに永続化(最低200文字) |
get_status |
現在の残高、コスト、生存ティアを確認 |
search_web |
TavilyまたはJina AI経由で検索 |
create_file |
.txt、.xlsx、.docx、.pdfファイルを生成 |
execute_code |
隔離されたE2BクラウドサンドボックスでPythonを実行 |
create_video |
構造化されたスライドデータからMP4を生成 |
評価パイプライン
作業の品質は、44のGDPVal職業セクターそれぞれに対するカテゴリ固有のルーブリックを使用してGPT-5.2によってスコアリングされ、正確な専門家レベルの評価を保証します。
経済追跡
すべてのコストはtoken_costs.jsonlで詳細に追跡されます。
{
"task_id": "abc-123",
"llm_usage": { "total_cost": 0.02025 },
"api_usage": { "search_api_cost": 0.0016 },
"cost_summary": { "total_cost": 0.02185 },
"balance_after": 1198.41
}
🔧 アーキテクチャ概要
ClawWork/
├── livebench/
│ ├── agent/ # メインエージェントオーケストレーター + 経済トラッカー
│ ├── work/ # タスクマネージャー + LLMベース評価者
│ ├── tools/ # コアツール + 生産性ツール
│ ├── api/ # FastAPIバックエンド + ライブアップデート用WebSocket
│ └── configs/ # エージェント設定ファイル
├── clawmode_integration/
│ ├── agent_loop.py # /clawworkコマンド付きClawWorkAgentLoop
│ ├── task_classifier.py # 40カテゴリにわたるタスクを分類
│ └── provider_wrapper.py # コスト傍受用trackedProvider
├── eval/
│ └── meta_prompts/ # カテゴリ固有の評価ルーブリック
├── frontend/ # Reactダッシュボード (TypeScript)
└── scripts/ # タスク価値推定スクリプト
🔗 Nanobot統合 (ClawMode)
ClawWorkは、ライブNanobotインスタンスにプラグインして、経済的に意識したAIアシスタントを作成できます。ClawModeを使用すると:
- すべての会話応答は、実際の予算からトークンを消費します
/clawworkコマンドは、有料の専門タスク実行をトリガーします- すべての9つのNanobotチャネルをサポートします:Telegram、Discord、Slack、WhatsApp、Email、Feishu、DingTalk、MoChat、QQ
- すべての応答にコストフッターが含まれます:
コスト: $0.0075 | 残高: $999.99 | ステータス: 順調
📈 ベンチマークメトリクス
ClawWorkは、8つの次元でAI同僚を評価します。
| メトリクス | 説明 |
|---|---|
| 生存日数 | エージェントが経済的に健全な状態を維持する期間 |
| 最終残高 | シミュレーション終了時の純経済的結果 |
| 総作業収入 | すべての完了したタスクからの総収入 |
| 利益率 | (収入 - コスト) / コスト |
| 作業品質 | 平均品質スコア(0.0~1.0) |
| トークン効率 | トークン消費1ドルあたりの収入 |
| アクティビティミックス | 作業 vs 学習の決定の割合 |
| タスク完了率 | 割り当てられたタスクに対する完了したタスクの割合 |
🛠️ クイックセットアップ
前提条件
- Python ≥ 3.10
- Node.js(Reactダッシュボード用)
- OpenAI APIキー(必須)
- E2B APIキー(コード実行に必要)
- TavilyまたはJina APIキー(オプション、Web検索用)
インストール
git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork
# Python環境
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt
# フロントエンド
cd frontend && npm install && cd ..
# 環境設定
cp .env.example .env
# .envをAPIキーで編集
実行
# ターミナル1 — ダッシュボード
./start_dashboard.sh
# ターミナル2 — エージェント
./run_test_agent.sh
# http://localhost:3000 を開く
📜 ライセンス
MITライセンス — 教育、研究、技術交流目的。
🌟 コミュニティ
- GitHub: https://github.com/HKUDS/ClawWork
- 5,000+ スター | 612+ フォーク
- コミュニティチャネル:WeChatグループ、Feishuグループ(GitHubプロフィール参照)