ClawWork: OpenClaw als Ihr KI-Mitarbeiter
💰 10.000 $ in 7 Stunden verdient — Ein wirtschaftlicher Benchmark aus der Praxis für KI-Agenten
GitHub: https://github.com/HKUDS/ClawWork
Live-Demo: https://hkuds.github.io/ClawWork/
Organisation: HKUDS (Hong Kong University of Science and Technology Data Systems Lab)
🧠 Was ist ClawWork?
ClawWork ist ein Open-Source-Framework, das KI-Assistenten in wirtschaftlich verantwortliche KI-Mitarbeiter verwandelt. Anstatt KI nur anhand traditioneller Benchmarks (Genauigkeit, MMLU, Reasoning-Scores) zu messen, stellt ClawWork eine praktischere Frage:
Kann ein KI-Agent tatsächlich Geld mit echter professioneller Arbeit verdienen?
KI-Agenten werden in eine simulierte professionelle Wirtschaft integriert, wo sie müssen:
- Reale Aufgaben in 44 Berufsfeldern erledigen
- Ihre eigenen Token-Nutzung aus einem Startbudget von nur 10 $ bezahlen
- Einkommen basierend auf der Qualität ihrer gelieferten Arbeit erzielen
- Wirtschaftlich überleben, indem sie einen positiven Saldo aufrechterhalten
Dies schafft ein einzigartig realistisches Bewertungsframework, bei dem die Einsätze greifbar sind und die Leistung in Dollar gemessen wird, nicht nur in Prozent.
🚀 Hauptmerkmale
💼 Benchmark für reale professionelle Aufgaben (GDPVal)
ClawWork wird vom GDPVal-Datensatz angetrieben — 220 reale professionelle Aufgaben in 44 Berufsfeldern, die ursprünglich von OpenAI entwickelt wurden, um den Beitrag von KI zum BIP abzuschätzen. Aufgabenkategorien umfassen:
| Domäne | Beispielberufe |
|---|---|
| Technologie & Ingenieurwesen | Computer-/IS-Manager, Produktionsleiter |
| Wirtschaft & Finanzen | Finanzanalysten, Wirtschaftsprüfer, Compliance-Beauftragte |
| Gesundheitswesen & soziale Dienste | Sozialarbeiter, Gesundheitsadministratoren |
| Recht, Medien & Betrieb | Verwaltungsmanager, Kundenservice |
Jede Aufgabe erfordert greifbare Ergebnisse: Word-Dokumente, Excel-Tabellen, PDFs, Datenanalysen, Projektpläne, Forschungsberichte und technische Spezifikationen.
💸 Extremer wirtschaftlicher Druck
- Agenten starten mit nur 10 $ auf ihrem Konto
- Jeder LLM-Token-Aufruf kostet echtes Geld (wird automatisch abgezogen)
- Einkommen wird erst nach Abschluss qualitätsgeprüfter Arbeit erzielt
- Ein einziger unachtsamer API-Aufruf oder eine schlechte Aufgabenabgabe kann den Agenten in den Bankrott treiben
- Die Zahlungsformel spiegelt die reale Wirtschaft wider:
Zahlung = Qualitäts_Score × (geschätzte_Stunden × BLS_Stundenlohn)
🏆 Multi-Modell-Wettbewerbsarena
ClawWork unterstützt den direkten Wettbewerb zwischen verschiedenen KI-Modellen gleichzeitig — GPT-4o, Claude Sonnet, Gemini Pro, Qwen, Kimi, GLM und mehr. Die Ergebnisse werden auf einer Live-Rangliste unter https://hkuds.github.io/ClawWork/ verfolgt.
Leistungsstarke Agenten erzielen verdienstäquivalente von 1.500 $/Stunde und übertreffen damit die typische Produktivität menschlicher Angestellter.
🪶 Ultraleichte Architektur
Auf Nanobot aufgebaut, erfordert ClawWork minimale Einrichtung:
pip install -r requirements.txt
cp .env.example .env # API-Schlüssel eintragen
./start_dashboard.sh # Dashboard starten
./run_test_agent.sh # Agent ausführen
📊 React-Dashboard
Ein Echtzeit-React-Dashboard unter http://localhost:3000 visualisiert:
- Live-Saldoänderungen (Liniendiagramm)
- Aktivitätsverteilung (Arbeits- vs. Lernentscheidungen)
- Aufgabenerledigungen mit Qualitätsbewertungen und Zahlungsbeträgen
- Wissensbasis zum Lernen
- Überlebensmetriken und wirtschaftlicher Status
⚙️ Funktionsweise
Agenten-Entscheidungs-Schleife
Jeden "Tag" in der Simulation steht der Agent vor einer binären strategischen Entscheidung:
- Arbeiten — Eine professionelle Aufgabe annehmen und abschließen, um Einkommen zu erzielen
- Lernen — Wissen studieren und speichern, um die zukünftige Leistung zu verbessern
Dies spiegelt reale Karriere-Kompromisse wider und führt strategische Tiefe über die einfache Aufgabenerledigung hinaus ein.
Agenten-Werkzeuge (8 verfügbar)
| Werkzeug | Beschreibung |
|---|---|
decide_activity |
Wählt work oder learn für die Sitzung |
submit_work |
Reicht abgeschlossene Artefakte zur Bewertung + Bezahlung ein |
learn |
Speichert Domänenwissen im Gedächtnis (mind. 200 Zeichen) |
get_status |
Überprüft aktuellen Saldo, Kosten und Überlebensstufe |
search_web |
Sucht über Tavily oder Jina AI |
create_file |
Erstellt .txt, .xlsx, .docx, .pdf Dateien |
execute_code |
Führt Python in einer isolierten E2B-Cloud-Sandbox aus |
create_video |
Erstellt MP4 aus strukturierten Folien-Daten |
Bewertungs-Pipeline
Die Arbeitsqualität wird von GPT-5.2 anhand kategoriespezifischer Bewertungsraster für jeden der 44 GDPVal-Berufssektoren bewertet, um eine genaue professionelle Bewertung zu gewährleisten.
Wirtschaftliche Verfolgung
Alle Kosten werden granular in token_costs.jsonl verfolgt:
{
"task_id": "abc-123",
"llm_usage": { "total_cost": 0.02025 },
"api_usage": { "search_api_cost": 0.0016 },
"cost_summary": { "total_cost": 0.02185 },
"balance_after": 1198.41
}
🔧 Architekturübersicht
ClawWork/
├── livebench/
│ ├── agent/ # Haupt-Agenten-Orchestrator + wirtschaftlicher Tracker
│ ├── work/ # Aufgabenmanager + LLM-basierter Bewerter
│ ├── tools/ # Kernwerkzeuge + Produktivitätswerkzeuge
│ ├── api/ # FastAPI-Backend + WebSocket für Live-Updates
│ └── configs/ # Agenten-Konfigurationsdateien
├── clawmode_integration/
│ ├── agent_loop.py # ClawWorkAgentLoop mit /clawwork-Befehl
│ ├── task_classifier.py # Klassifiziert Aufgaben in 40 Kategorien
│ └── provider_wrapper.py # TrackedProvider für Kostenabfangung
├── eval/
│ └── meta_prompts/ # Kategoriespezifische Bewertungsraster
├── frontend/ # React-Dashboard (TypeScript)
└── scripts/ # Skripte zur Schätzung des Aufgabennutzens
🔗 Nanobot-Integration (ClawMode)
ClawWork kann in eine Live-Nanobot-Instanz integriert werden, um einen wirtschaftlich bewussten KI-Assistenten zu erstellen. Mit ClawMode:
- Jede Gesprächsantwort kostet Token aus dem realen Budget
- Der Befehl
/clawworklöst die Ausführung bezahlter professioneller Aufgaben aus - Unterstützt alle 9 Nanobot-Kanäle: Telegram, Discord, Slack, WhatsApp, E-Mail, Feishu, DingTalk, MoChat, QQ
- Jede Antwort enthält eine Kosten-Fußzeile:
Kosten: 0,0075 $ | Saldo: 999,99 $ | Status: florierend
📈 Benchmark-Metriken
ClawWork bewertet KI-Mitarbeiter anhand von 8 Dimensionen:
| Metrik | Beschreibung |
|---|---|
| Überlebenstage | Wie lange der Agent wirtschaftlich zahlungsfähig bleibt |
| Endsaldo | Nettoergebnis am Ende der Simulation |
| Gesamtarbeitsverdienst | Bruttoeinnahmen aus allen abgeschlossenen Aufgaben |
| Gewinnmarge | (Einnahmen - Kosten) / Kosten |
| Arbeitsqualität | Durchschnittliche Qualitätsbewertung (0,0 – 1,0) |
| Token-Effizienz | Pro Dollar ausgegebener Token erzielte Einnahmen |
| Aktivitätsmix | Prozentsatz der Arbeits- vs. Lernentscheidungen |
| Aufgabenerledigungsrate | Erledigte Aufgaben vs. zugewiesene Aufgaben |
🛠️ Schnelle Einrichtung
Voraussetzungen
- Python ≥ 3.10
- Node.js (für React-Dashboard)
- OpenAI API-Schlüssel (erforderlich)
- E2B API-Schlüssel (erforderlich für Codeausführung)
- Tavily- oder Jina-API-Schlüssel (optional, für Websuche)
Installation
git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork
# Python-Umgebung
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt
# Frontend
cd frontend && npm install && cd ..
# Umgebung konfigurieren
cp .env.example .env
# Bearbeiten Sie .env mit Ihren API-Schlüsseln
Ausführung
# Terminal 1 — Dashboard
./start_dashboard.sh
# Terminal 2 — Agent
./run_test_agent.sh
# Öffnen Sie http://localhost:3000
📜 Lizenz
MIT-Lizenz — für Bildungs-, Forschungs- und technischen Austauschzwecke.
🌟 Community
- GitHub: https://github.com/HKUDS/ClawWork
- 5.000+ Sterne | 612+ Forks
- Community-Kanäle: WeChat-Gruppe, Feishu-Gruppe (siehe GitHub-Profil)