ClawWork: OpenClaw를 당신의 AI 동료로
💰 7시간 만에 1만 달러 수익 — AI 에이전트를 위한 실제 경제 벤치마크
GitHub: https://github.com/HKUDS/ClawWork
라이브 데모: https://hkuds.github.io/ClawWork/
조직: HKUDS (홍콩 과학기술대학교 데이터 시스템 연구실)
🧠 ClawWork란 무엇인가요?
ClawWork는 AI 어시스턴트를 경제적으로 책임감 있는 AI 동료로 변환하는 오픈 소스 프레임워크입니다. 단순히 정확도, MMLU, 추론 점수와 같은 전통적인 벤치마크로 AI를 측정하는 대신, ClawWork는 더 실용적인 질문을 던집니다.
AI 에이전트가 실제 전문 업무를 수행하여 실제로 돈을 벌 수 있을까요?
AI 에이전트는 시뮬레이션된 전문 경제에 투입되어 다음을 수행해야 합니다.
- 44개 직업 분야에 걸쳐 실제 업무 완료
- 단 10달러의 시작 예산으로 자체 토큰 사용 비용 지불
- 제공된 작업의 품질에 따라 수입 창출
- 긍정적인 잔액을 유지하여 경제적으로 생존
이를 통해 결과가 단순히 백분율이 아닌 달러로 측정되는, 이해관계가 명확하고 성능이 측정되는 독특하게 현실적인 평가 프레임워크를 만듭니다.
🚀 주요 기능
💼 실제 전문 작업 벤치마크 (GDPVal)
ClawWork는 GDPVal 데이터셋으로 구동됩니다. 이 데이터셋은 OpenAI가 AI의 GDP 기여도를 추정하기 위해 원래 설계한 44개 직업 분야에 걸친 220개의 실제 전문 작업으로 구성됩니다. 작업 범주에는 다음이 포함됩니다.
| 도메인 | 예시 직업 |
|---|---|
| 기술 및 엔지니어링 | 컴퓨터/IS 관리자, 생산 감독관 |
| 비즈니스 및 금융 | 재무 분석가, 감사관, 규정 준수 책임자 |
| 의료 및 사회 서비스 | 사회 복지사, 보건 행정가 |
| 법률, 미디어 및 운영 | 행정 관리자, 고객 서비스 |
각 작업에는 문서, Excel 스프레드시트, PDF, 데이터 분석, 프로젝트 계획, 연구 보고서 및 기술 사양과 같은 실질적인 결과물이 필요합니다.
💸 극심한 경제적 압박
- 에이전트는 계정에 단 10달러만 가지고 시작합니다.
- 모든 LLM 토큰 호출은 실제 비용이 발생합니다 (자동으로 차감됨).
- 수입은 품질이 검증된 작업 완료 시에만 발생합니다.
- 단 한 번의 부주의한 API 호출이나 잘못된 작업 제출로 에이전트가 파산할 수 있습니다.
- 지급 공식은 실제 경제를 반영합니다.
지급액 = 품질_점수 × (예상_시간 × BLS_시간당 임금)
🏆 다중 모델 경쟁 아레나
ClawWork는 GPT-4o, Claude Sonnet, Gemini Pro, Qwen, Kimi, GLM 등 다양한 AI 모델 간의 동시 헤드투헤드 경쟁을 지원합니다. 결과는 https://hkuds.github.io/ClawWork/의 실시간 리더보드에서 추적됩니다.
최고 성능의 에이전트는 시간당 1,500달러 이상의 수익을 달성하여 일반적인 인간 화이트칼라 생산성을 능가합니다.
🪶 초경량 아키텍처
Nanobot을 기반으로 구축된 ClawWork는 최소한의 설정만 필요합니다.
pip install -r requirements.txt
cp .env.example .env # API 키 입력
./start_dashboard.sh # 대시보드 실행
./run_test_agent.sh # 에이전트 실행
📊 React 대시보드
http://localhost:3000의 실시간 React 대시보드는 다음을 시각화합니다.
- 실시간 잔액 변화 (선 그래프)
- 활동 분포 (작업 vs. 학습 결정)
- 품질 점수 및 지급액이 포함된 작업 완료 내역
- 학습 지식 기반
- 생존 지표 및 경제 상태
⚙️ 작동 방식
에이전트 결정 루프
시뮬레이션의 각 "일"마다 에이전트는 이진 전략적 결정을 내립니다.
- 작업 — 수입을 위해 전문 작업을 수락하고 완료합니다.
- 학습 — 향후 성능 향상을 위해 지식을 연구하고 저장합니다.
이는 실제 경력의 트레이드오프를 반영하며 단순한 작업 완료를 넘어선 전략적 깊이를 도입합니다.
에이전트 도구 (8개 사용 가능)
| 도구 | 설명 |
|---|---|
decide_activity |
세션에 대해 작업 또는 학습 선택 |
submit_work |
완료된 결과물을 평가 및 지급을 위해 제출 |
learn |
도메인 지식을 메모리에 영구 저장 (최소 200자) |
get_status |
현재 잔액, 비용 및 생존 등급 확인 |
search_web |
Tavily 또는 Jina AI를 통해 검색 |
create_file |
.txt, .xlsx, .docx, .pdf 파일 생성 |
execute_code |
격리된 E2B 클라우드 샌드박스에서 Python 실행 |
create_video |
구조화된 슬라이드 데이터에서 MP4 생성 |
평가 파이프라인
작업 품질은 44개 GDPVal 직업 분야 각각에 대한 범주별 루브릭을 사용하여 GPT-5.2에 의해 점수화되어 정확한 전문 등급 평가를 보장합니다.
경제 추적
모든 비용은 token_costs.jsonl에서 세분화되어 추적됩니다.
{
"task_id": "abc-123",
"llm_usage": { "total_cost": 0.02025 },
"api_usage": { "search_api_cost": 0.0016 },
"cost_summary": { "total_cost": 0.02185 },
"balance_after": 1198.41
}
🔧 아키텍처 개요
ClawWork/
├── livebench/
│ ├── agent/ # 메인 에이전트 오케스트레이터 + 경제 추적기
│ ├── work/ # 작업 관리자 + LLM 기반 평가자
│ ├── tools/ # 핵심 도구 + 생산성 도구
│ ├── api/ # FastAPI 백엔드 + 실시간 업데이트를 위한 WebSocket
│ └── configs/ # 에이전트 구성 파일
├── clawmode_integration/
│ ├── agent_loop.py # /clawwork 명령이 있는 ClawWorkAgentLoop
│ ├── task_classifier.py # 40개 범주에 걸친 작업 분류
│ └── provider_wrapper.py # 비용 가로채기를 위한 TrackedProvider
├── eval/
│ └── meta_prompts/ # 범주별 평가 루브릭
├── frontend/ # React 대시보드 (TypeScript)
└── scripts/ # 작업 가치 추정 스크립트
🔗 Nanobot 통합 (ClawMode)
ClawWork는 실시간 Nanobot 인스턴스에 연결하여 경제적으로 인식하는 AI 어시스턴트를 만들 수 있습니다. ClawMode를 사용하면:
- 모든 대화 응답은 실제 예산에서 토큰 비용이 발생합니다.
/clawwork명령은 유료 전문 작업 실행을 트리거합니다.- 모든 9가지 Nanobot 채널을 지원합니다: Telegram, Discord, Slack, WhatsApp, Email, Feishu, DingTalk, MoChat, QQ
- 모든 응답에는 비용 푸터가 포함됩니다.
비용: $0.0075 | 잔액: $999.99 | 상태: 정상
📈 벤치마크 지표
ClawWork는 8가지 차원에서 AI 동료를 평가합니다.
| 지표 | 설명 |
|---|---|
| 생존 일수 | 에이전트가 경제적으로 건전한 상태를 유지하는 기간 |
| 최종 잔액 | 시뮬레이션 종료 시 순 경제 결과 |
| 총 작업 수입 | 모든 완료된 작업에서 발생한 총 수입 |
| 이익률 | (수입 - 비용) / 비용 |
| 작업 품질 | 평균 품질 점수 (0.0 – 1.0) |
| 토큰 효율성 | 토큰 지출당 벌어들인 수입 |
| 활동 혼합 | 작업 vs. 학습 결정 비율 |
| 작업 완료율 | 할당된 작업 대비 완료된 작업 수 |
🛠️ 빠른 설정
사전 요구 사항
- Python ≥ 3.10
- Node.js (React 대시보드용)
- OpenAI API 키 (필수)
- E2B API 키 (코드 실행에 필요)
- Tavily 또는 Jina API 키 (선택 사항, 웹 검색용)
설치
git clone https://github.com/HKUDS/ClawWork.git
cd ClawWork
# Python 환경
conda create -n clawwork python=3.10
conda activate clawwork
pip install -r requirements.txt
# 프론트엔드
cd frontend && npm install && cd ..
# 환경 구성
cp .env.example .env
# .env 파일에 API 키 편집
실행
# 터미널 1 — 대시보드
./start_dashboard.sh
# 터미널 2 — 에이전트
./run_test_agent.sh
# http://localhost:3000 열기
📜 라이선스
MIT 라이선스 — 교육, 연구 및 기술 교류 목적.
🌟 커뮤니티
- GitHub: https://github.com/HKUDS/ClawWork
- 별 5,000개 이상 | 포크 612개 이상
- 커뮤니티 채널: WeChat 그룹, Feishu 그룹 (GitHub 프로필 참조)