Start / Open Source / ClawWork

ClawWork

ClawWork verwandelt KI-Assistenten in wirtschaftlich verantwortliche KI-Mitarbeiter, die echte professionelle Aufgaben erledigen, Einkommen erzielen und in 220 BIP-validierten Aufgaben aus 44 Industriesektoren konkurrieren.

PythonMITAgent
⭐ GitHubhttps://github.com/HKUDS/ClawWork
8,298
Stars
+84
Star-Wachstum
Mar 3, 2026
Zuletzt aktualisiert
2,369
Klicks

ClawWork: OpenClaw als Ihr KI-Mitarbeiter

💰 10.000 $ in 7 Stunden verdient — Ein wirtschaftlicher Benchmark aus der Praxis für KI-Agenten

GitHub: https://github.com/HKUDS/ClawWork
Live-Demo: https://hkuds.github.io/ClawWork/
Organisation: HKUDS (Hong Kong University of Science and Technology Data Systems Lab)


🧠 Was ist ClawWork?

ClawWork ist ein Open-Source-Framework, das KI-Assistenten in wirtschaftlich verantwortliche KI-Mitarbeiter verwandelt. Anstatt KI nur anhand traditioneller Benchmarks (Genauigkeit, MMLU, Reasoning-Scores) zu messen, stellt ClawWork eine praktischere Frage:

Kann ein KI-Agent tatsächlich Geld mit echter professioneller Arbeit verdienen?

KI-Agenten werden in eine simulierte professionelle Wirtschaft integriert, wo sie müssen:

  • Reale Aufgaben in 44 Berufsfeldern erledigen
  • Ihre eigenen Token-Nutzung aus einem Startbudget von nur 10 $ bezahlen
  • Einkommen basierend auf der Qualität ihrer gelieferten Arbeit erzielen
  • Wirtschaftlich überleben, indem sie einen positiven Saldo aufrechterhalten

Dies schafft ein einzigartig realistisches Bewertungsframework, bei dem die Einsätze greifbar sind und die Leistung in Dollar gemessen wird, nicht nur in Prozent.


🚀 Hauptmerkmale

💼 Benchmark für reale professionelle Aufgaben (GDPVal)

ClawWork wird vom GDPVal-Datensatz angetrieben — 220 reale professionelle Aufgaben in 44 Berufsfeldern, die ursprünglich von OpenAI entwickelt wurden, um den Beitrag von KI zum BIP abzuschätzen. Aufgabenkategorien umfassen:

Domäne Beispielberufe
Technologie & Ingenieurwesen Computer-/IS-Manager, Produktionsleiter
Wirtschaft & Finanzen Finanzanalysten, Wirtschaftsprüfer, Compliance-Beauftragte
Gesundheitswesen & soziale Dienste Sozialarbeiter, Gesundheitsadministratoren
Recht, Medien & Betrieb Verwaltungsmanager, Kundenservice

Jede Aufgabe erfordert greifbare Ergebnisse: Word-Dokumente, Excel-Tabellen, PDFs, Datenanalysen, Projektpläne, Forschungsberichte und technische Spezifikationen.

💸 Extremer wirtschaftlicher Druck

  • Agenten starten mit nur 10 $ auf ihrem Konto
  • Jeder LLM-Token-Aufruf kostet echtes Geld (wird automatisch abgezogen)
  • Einkommen wird erst nach Abschluss qualitätsgeprüfter Arbeit erzielt
  • Ein einziger unachtsamer API-Aufruf oder eine schlechte Aufgabenabgabe kann den Agenten in den Bankrott treiben
  • Die Zahlungsformel spiegelt die reale Wirtschaft wider:
    Zahlung = Qualitäts_Score × (geschätzte_Stunden × BLS_Stundenlohn)

🏆 Multi-Modell-Wettbewerbsarena

ClawWork unterstützt den direkten Wettbewerb zwischen verschiedenen KI-Modellen gleichzeitig — GPT-4o, Claude Sonnet, Gemini Pro, Qwen, Kimi, GLM und mehr. Die Ergebnisse werden auf einer Live-Rangliste unter https://hkuds.github.io/ClawWork/ verfolgt.

Leistungsstarke Agenten erzielen verdienstäquivalente von 1.500 $/Stunde und übertreffen damit die typische Produktivität menschlicher Angestellter.

🪶 Ultraleichte Architektur

Auf Nanobot aufgebaut, erfordert ClawWork minimale Einrichtung:

pip install -r requirements.txt
cp .env.example .env  # API-Schlüssel eintragen
./start_dashboard.sh  # Dashboard starten
./run_test_agent.sh   # Agent ausführen

📊 React-Dashboard

Ein Echtzeit-React-Dashboard unter http://localhost:3000 visualisiert:

  • Live-Saldoänderungen (Liniendiagramm)
  • Aktivitätsverteilung (Arbeits- vs. Lernentscheidungen)
  • Aufgabenerledigungen mit Qualitätsbewertungen und Zahlungsbeträgen
  • Wissensbasis zum Lernen
  • Überlebensmetriken und wirtschaftlicher Status

⚙️ Funktionsweise

Agenten-Entscheidungs-Schleife

Jeden "Tag" in der Simulation steht der Agent vor einer binären strategischen Entscheidung:

  1. Arbeiten — Eine professionelle Aufgabe annehmen und abschließen, um Einkommen zu erzielen
  2. Lernen — Wissen studieren und speichern, um die zukünftige Leistung zu verbessern

Dies spiegelt reale Karriere-Kompromisse wider und führt strategische Tiefe über die einfache Aufgabenerledigung hinaus ein.

Agenten-Werkzeuge (8 verfügbar)

Werkzeug Beschreibung
decide_activity Wählt work oder learn für die Sitzung
submit_work Reicht abgeschlossene Artefakte zur Bewertung + Bezahlung ein
learn Speichert Domänenwissen im Gedächtnis (mind. 200 Zeichen)
get_status Überprüft aktuellen Saldo, Kosten und Überlebensstufe
search_web Sucht über Tavily oder Jina AI
create_file Erstellt .txt, .xlsx, .docx, .pdf Dateien
execute_code Führt Python in einer isolierten E2B-Cloud-Sandbox aus
create_video Erstellt MP4 aus strukturierten Folien-Daten

Bewertungs-Pipeline

Die Arbeitsqualität wird von GPT-5.2 anhand kategoriespezifischer Bewertungsraster für jeden der 44 GDPVal-Berufssektoren bewertet, um eine genaue professionelle Bewertung zu gewährleisten.

Wirtschaftliche Verfolgung

Alle Kosten werden granular in token_costs.jsonl verfolgt:

{
  "task_id": "abc-123",
  "llm_usage": { "total_cost": 0.02025 },
  "api_usage": { "search_api_cost": 0.0016 },
  "cost_summary": { "total_cost": 0.02185 },
  "balance_after": 1198.41
}

🔧 Architekturübersicht

ClawWork/
├── livebench/
│   ├── agent/          # Haupt-Agenten-Orchestrator + wirtschaftlicher Tracker
│   ├── work/           # Aufgabenmanager + LLM-basierter Bewerter
│   ├── tools/          # Kernwerkzeuge + Produktivitätswerkzeuge
│   ├── api/            # FastAPI-Backend + WebSocket für Live-Updates
│   └── configs/        # Agenten-Konfigurationsdateien
├── clawmode_integration/
│   ├── agent_loop.py   # ClawWorkAgentLoop mit /clawwork-Befehl
│   ├── task_classifier.py  # Klassifiziert Aufgaben in 40 Kategorien
│   └── provider_wrapper.py # TrackedProvider für Kostenabfangung
├── eval/
│   └── meta_prompts/   # Kategoriespezifische Bewertungsraster
├── frontend/           # React-Dashboard (TypeScript)
└── scripts/            # Skripte zur Schätzung des Aufgabennutzens

🔗 Nanobot-Integration (ClawMode)

ClawWork kann in eine Live-Nanobot-Instanz integriert werden, um einen wirtschaftlich bewussten KI-Assistenten zu erstellen. Mit ClawMode:

  • Jede Gesprächsantwort kostet Token aus dem realen Budget
  • Der Befehl /clawwork löst die Ausführung bezahlter professioneller Aufgaben aus
  • Unterstützt alle 9 Nanobot-Kanäle: Telegram, Discord, Slack, WhatsApp, E-Mail, Feishu, DingTalk, MoChat, QQ
  • Jede Antwort enthält eine Kosten-Fußzeile:
    Kosten: 0,0075 $ | Saldo: 999,99 $ | Status: florierend

📈 Benchmark-Metriken

ClawWork bewertet KI-Mitarbeiter anhand von 8 Dimensionen:

Metrik Beschreibung
Überlebenstage Wie lange der Agent wirtschaftlich zahlungsfähig bleibt
Endsaldo Nettoergebnis am Ende der Simulation
Gesamtarbeitsverdienst Bruttoeinnahmen aus allen abgeschlossenen Aufgaben
Gewinnmarge (Einnahmen - Kosten) / Kosten
Arbeitsqualität Durchschnittliche Qualitätsbewertung (0,0 – 1,0)
Token-Effizienz Pro Dollar ausgegebener Token erzielte Einnahmen
Aktivitätsmix Prozentsatz der Arbeits- vs. Lernentscheidungen
Aufgabenerledigungsrate Erledigte Aufgaben vs. zugewiesene Aufgaben

🛠️ Schnelle Einrichtung

Voraussetzungen

  • Python ≥ 3.10
  • Node.js (für React-Dashboard)
  • OpenAI API-Schlüssel (erforderlich)
  • E2B API-Schlüssel (erforderlich für Codeausführung)
  • Tavily- oder Jina-API-Schlüssel (optional, für Websuche)

Installation

git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork

# Python-Umgebung
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt

# Frontend
cd frontend && npm install && cd ..

# Umgebung konfigurieren
cp .env.example .env
# Bearbeiten Sie .env mit Ihren API-Schlüsseln

Ausführung

# Terminal 1 — Dashboard
./start_dashboard.sh

# Terminal 2 — Agent
./run_test_agent.sh

# Öffnen Sie http://localhost:3000

📜 Lizenz

MIT-Lizenz — für Bildungs-, Forschungs- und technischen Austauschzwecke.


🌟 Community