/ 오픈소스 / ClawWork

ClawWork

ClawWork는 AI 비서를 경제적으로 책임감 있는 AI 동료로 전환하여 실제 전문 작업을 완료하고, 수입을 창출하며, 44개 산업 분야에 걸친 220개의 GDP 검증 작업을 통해 경쟁합니다.

PythonMITAgent
⭐ GitHubhttps://github.com/HKUDS/ClawWork
8,298
스타 수
+84
스타 증가율
Mar 3, 2026
최근 업데이트
2,369
클릭 수

ClawWork: OpenClaw를 당신의 AI 동료로

💰 7시간 만에 1만 달러 수익 — AI 에이전트를 위한 실제 경제 벤치마크

GitHub: https://github.com/HKUDS/ClawWork
라이브 데모: https://hkuds.github.io/ClawWork/
조직: HKUDS (홍콩 과학기술대학교 데이터 시스템 연구실)


🧠 ClawWork란 무엇인가요?

ClawWork는 AI 어시스턴트를 경제적으로 책임감 있는 AI 동료로 변환하는 오픈 소스 프레임워크입니다. 단순히 정확도, MMLU, 추론 점수와 같은 전통적인 벤치마크로 AI를 측정하는 대신, ClawWork는 더 실용적인 질문을 던집니다.

AI 에이전트가 실제 전문 업무를 수행하여 실제로 돈을 벌 수 있을까요?

AI 에이전트는 시뮬레이션된 전문 경제에 투입되어 다음을 수행해야 합니다.

  • 44개 직업 분야에 걸쳐 실제 업무 완료
  • 10달러의 시작 예산으로 자체 토큰 사용 비용 지불
  • 제공된 작업의 품질에 따라 수입 창출
  • 긍정적인 잔액을 유지하여 경제적으로 생존

이를 통해 결과가 단순히 백분율이 아닌 달러로 측정되는, 이해관계가 명확하고 성능이 측정되는 독특하게 현실적인 평가 프레임워크를 만듭니다.


🚀 주요 기능

💼 실제 전문 작업 벤치마크 (GDPVal)

ClawWork는 GDPVal 데이터셋으로 구동됩니다. 이 데이터셋은 OpenAI가 AI의 GDP 기여도를 추정하기 위해 원래 설계한 44개 직업 분야에 걸친 220개의 실제 전문 작업으로 구성됩니다. 작업 범주에는 다음이 포함됩니다.

도메인 예시 직업
기술 및 엔지니어링 컴퓨터/IS 관리자, 생산 감독관
비즈니스 및 금융 재무 분석가, 감사관, 규정 준수 책임자
의료 및 사회 서비스 사회 복지사, 보건 행정가
법률, 미디어 및 운영 행정 관리자, 고객 서비스

각 작업에는 문서, Excel 스프레드시트, PDF, 데이터 분석, 프로젝트 계획, 연구 보고서 및 기술 사양과 같은 실질적인 결과물이 필요합니다.

💸 극심한 경제적 압박

  • 에이전트는 계정에 단 10달러만 가지고 시작합니다.
  • 모든 LLM 토큰 호출은 실제 비용이 발생합니다 (자동으로 차감됨).
  • 수입은 품질이 검증된 작업 완료 시에만 발생합니다.
  • 단 한 번의 부주의한 API 호출이나 잘못된 작업 제출로 에이전트가 파산할 수 있습니다.
  • 지급 공식은 실제 경제를 반영합니다.
    지급액 = 품질_점수 × (예상_시간 × BLS_시간당 임금)

🏆 다중 모델 경쟁 아레나

ClawWork는 GPT-4o, Claude Sonnet, Gemini Pro, Qwen, Kimi, GLM 등 다양한 AI 모델 간의 동시 헤드투헤드 경쟁을 지원합니다. 결과는 https://hkuds.github.io/ClawWork/의 실시간 리더보드에서 추적됩니다.

최고 성능의 에이전트는 시간당 1,500달러 이상의 수익을 달성하여 일반적인 인간 화이트칼라 생산성을 능가합니다.

🪶 초경량 아키텍처

Nanobot을 기반으로 구축된 ClawWork는 최소한의 설정만 필요합니다.

pip install -r requirements.txt
cp .env.example .env  # API 키 입력
./start_dashboard.sh  # 대시보드 실행
./run_test_agent.sh   # 에이전트 실행

📊 React 대시보드

http://localhost:3000의 실시간 React 대시보드는 다음을 시각화합니다.

  • 실시간 잔액 변화 (선 그래프)
  • 활동 분포 (작업 vs. 학습 결정)
  • 품질 점수 및 지급액이 포함된 작업 완료 내역
  • 학습 지식 기반
  • 생존 지표 및 경제 상태

⚙️ 작동 방식

에이전트 결정 루프

시뮬레이션의 각 "일"마다 에이전트는 이진 전략적 결정을 내립니다.

  1. 작업 — 수입을 위해 전문 작업을 수락하고 완료합니다.
  2. 학습 — 향후 성능 향상을 위해 지식을 연구하고 저장합니다.

이는 실제 경력의 트레이드오프를 반영하며 단순한 작업 완료를 넘어선 전략적 깊이를 도입합니다.

에이전트 도구 (8개 사용 가능)

도구 설명
decide_activity 세션에 대해 작업 또는 학습 선택
submit_work 완료된 결과물을 평가 및 지급을 위해 제출
learn 도메인 지식을 메모리에 영구 저장 (최소 200자)
get_status 현재 잔액, 비용 및 생존 등급 확인
search_web Tavily 또는 Jina AI를 통해 검색
create_file .txt, .xlsx, .docx, .pdf 파일 생성
execute_code 격리된 E2B 클라우드 샌드박스에서 Python 실행
create_video 구조화된 슬라이드 데이터에서 MP4 생성

평가 파이프라인

작업 품질은 44개 GDPVal 직업 분야 각각에 대한 범주별 루브릭을 사용하여 GPT-5.2에 의해 점수화되어 정확한 전문 등급 평가를 보장합니다.

경제 추적

모든 비용은 token_costs.jsonl에서 세분화되어 추적됩니다.

{
  "task_id": "abc-123",
  "llm_usage": { "total_cost": 0.02025 },
  "api_usage": { "search_api_cost": 0.0016 },
  "cost_summary": { "total_cost": 0.02185 },
  "balance_after": 1198.41
}

🔧 아키텍처 개요

ClawWork/
├── livebench/
│   ├── agent/          # 메인 에이전트 오케스트레이터 + 경제 추적기
│   ├── work/           # 작업 관리자 + LLM 기반 평가자
│   ├── tools/          # 핵심 도구 + 생산성 도구
│   ├── api/            # FastAPI 백엔드 + 실시간 업데이트를 위한 WebSocket
│   └── configs/        # 에이전트 구성 파일
├── clawmode_integration/
│   ├── agent_loop.py   # /clawwork 명령이 있는 ClawWorkAgentLoop
│   ├── task_classifier.py  # 40개 범주에 걸친 작업 분류
│   └── provider_wrapper.py # 비용 가로채기를 위한 TrackedProvider
├── eval/
│   └── meta_prompts/   # 범주별 평가 루브릭
├── frontend/           # React 대시보드 (TypeScript)
└── scripts/            # 작업 가치 추정 스크립트

🔗 Nanobot 통합 (ClawMode)

ClawWork는 실시간 Nanobot 인스턴스에 연결하여 경제적으로 인식하는 AI 어시스턴트를 만들 수 있습니다. ClawMode를 사용하면:

  • 모든 대화 응답은 실제 예산에서 토큰 비용이 발생합니다.
  • /clawwork 명령은 유료 전문 작업 실행을 트리거합니다.
  • 모든 9가지 Nanobot 채널을 지원합니다: Telegram, Discord, Slack, WhatsApp, Email, Feishu, DingTalk, MoChat, QQ
  • 모든 응답에는 비용 푸터가 포함됩니다.
    비용: $0.0075 | 잔액: $999.99 | 상태: 정상

📈 벤치마크 지표

ClawWork는 8가지 차원에서 AI 동료를 평가합니다.

지표 설명
생존 일수 에이전트가 경제적으로 건전한 상태를 유지하는 기간
최종 잔액 시뮬레이션 종료 시 순 경제 결과
총 작업 수입 모든 완료된 작업에서 발생한 총 수입
이익률 (수입 - 비용) / 비용
작업 품질 평균 품질 점수 (0.0 – 1.0)
토큰 효율성 토큰 지출당 벌어들인 수입
활동 혼합 작업 vs. 학습 결정 비율
작업 완료율 할당된 작업 대비 완료된 작업 수

🛠️ 빠른 설정

사전 요구 사항

  • Python ≥ 3.10
  • Node.js (React 대시보드용)
  • OpenAI API 키 (필수)
  • E2B API 키 (코드 실행에 필요)
  • Tavily 또는 Jina API 키 (선택 사항, 웹 검색용)

설치

git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork

# Python 환경
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt

# 프론트엔드
cd frontend && npm install && cd ..

# 환경 구성
cp .env.example .env
# .env 파일에 API 키 편집

실행

# 터미널 1 — 대시보드
./start_dashboard.sh

# 터미널 2 — 에이전트
./run_test_agent.sh

# http://localhost:3000 열기

📜 라이선스

MIT 라이선스 — 교육, 연구 및 기술 교류 목적.


🌟 커뮤니티