1. 프로젝트 개요
BrowserAct Skills는 AI 에이전트(Claude Code, Cursor, VS Code 및 기타 셸 실행이 가능한 에이전트)가 실제 브라우저를 구동해 웹 작업을 완료할 수 있게 해주는 오픈소스 브라우저 자동화 CLI입니다. 안티봇 시스템으로 보호되는 사이트도 지원하며, 에이전트가 막혔을 때는 사람 운영자에게 제어를 넘길 수 있습니다.
2. 배경 및 포지셔닝
대부분의 브라우저 자동화 프레임워크는 CAPTCHA도 없고, 핑거프린팅도 없고, 로그인 장벽도 없는 깨끗하고 협조적인 웹을 가정합니다. 하지만 실제로 AI 에이전트가 실제 사이트를 탐색하거나 검색하거나 데이터를 추출하려고 하면, 순진한 자동화를 무너뜨리는 안티봇 방어, 지역 제한, 계정 기반 콘텐츠에 끊임없이 부딪히게 됩니다. BrowserAct는 바로 그 간극을 메우기 위해 만들어졌으며, "에이전트는 결국 차단된다"를 예외가 아닌 기본 상황으로 간주하고 그에 맞춰 설계되었습니다.
핵심 사명은 에이전트에게 회복 탄력성이 있고 토큰 효율적인 라이브 웹 인터페이스를 제공하는 동시에, 자동화가 정말로 더 이상 진행될 수 없을 때 사용할 수 있는 탈출구를 내장하는 것입니다. 바로 라이브 원격 제어 URL을 통해 사람에게 제어를 넘기고, 사람이 끝나면 에이전트가 자동으로 재개되는 방식입니다.
범용 브라우저 자동화 라이브러리(예: Playwright/Puppeteer 래퍼)와 비교했을 때 BrowserAct는 세 가지 측면에서 다릅니다.
- 회피를 전적으로 호출자에게 맡기지 않고 3계층 안티봇 전략(환경, 실행, 사람)을 기본 제공합니다.
- 원시 DOM/HTML/JSON 대신 인덱싱된 텍스트 기반 페이지 상태를 반환하므로 LLM 토큰 비용이 훨씬 저렴하고 에이전트가 추론하기도 쉽습니다.
- 인기 플랫폼(Amazon, YouTube, Google Maps, Instagram 등)을 위한 30개 이상의 즉시 사용 가능한 Skills 카탈로그를 번들로 제공하므로, 일반적인 스크래핑 작업을 처음부터 자동화 코드로 작성할 필요가 없습니다.
3. 기능 카테고리
🛡️ 안티봇 보호(3계층 접근법) — 방어가 적용된 사이트에서도 자동화를 계속 실행하기 위한 메커니즘입니다.
- 봇 탐지 시그니처를 피하기 위한 스텔스 브라우저 핑거프린팅
- TLS 핑거프린트 순환
- IP 다양성을 위한 프록시 순환
- 자동 CAPTCHA 해결
- 자동화가 완전히 차단되었을 때 사용하는 라이브 인간 인계 URL
목적: 사이트가 자동화된 접근을 적극적으로 거부하더라도 오래 걸리거나 민감한 작업을 계속 유지합니다.
🌐 브라우저 모드 — 작업에 따라 다른 세션 ID를 사용합니다.
- Chrome 모드(로컬 브라우저의 기존 로그인 상태 재사용)
- 스텔스 프라이버시 모드(세션마다 새로워 서로 연결할 수 없는 핑거프린트)
- 스텔스 고정 ID 모드(세션 전반에 걸쳐 핑거프린트/계정 유지)
목적: 로그인 워크플로, 익명 스크래핑, 일관된 장기 계정 등 작업에 맞게 자동화 ID를 일치시킵니다.
🤖 에이전트 최적화 상호작용 — 에이전트가 직접 호출하는 핵심 CLI 기본 기능입니다.
- 원시 셀렉터 대신 인덱싱된 상호작용(
click 3,input 5 "text") - 간결하고 토큰 효율적인 텍스트 상태 출력
- 작업 간 간섭 없는 다중 세션, 다중 브라우저 동시 실행
목적: 사람이 쓰는 스크립트가 아니라 LLM 기반 에이전트에게 브라우저 제어를 저렴하고 안정적으로 만듭니다.
📦 솔루션 카탈로그(30개 이상의 사전 구축 Skills) — 일반적인 대상에 바로 사용할 수 있는 자동화입니다.
- Amazon, eBay, Etsy, Walmart(상품/리스팅/리뷰 추출)
- YouTube, TikTok, Instagram, X/Twitter(콘텐츠, 댓글, 프로필 데이터)
- Google Maps, LinkedIn, Indeed(리드, 비즈니스 정보, 채용 공고)
- Reddit, 샤오홍슈, 더우인, 즈후, 위챗(지역 플랫폼 커버리지)
목적: 커뮤니티가 이미 다루고 있는 플랫폼의 스크래퍼를 다시 구현하는 일을 건너뜁니다.
🛠️ Skill Forge — 새로운 Skill을 생성하는 동반 도구입니다.
- 대상 사이트를 한 번 탐색한 다음 재사용 및 배포 가능한 스크래핑 Skill을 생성합니다.
목적: 일회성 수동 탐색을 반복 가능하고 공유 가능한 자동화 자산으로 전환합니다.
4. 주요 하이라이트
- 상태를 잃지 않는 인간 인계 — 에이전트가 벽에 부딪혔을 때(CAPTCHA, 2FA, 수동 인증) 라이브 원격 제어 링크를 생성할 수 있습니다. 사람이 어떤 기기에서든 인계받고, 이후 에이전트가 세션을 처음부터 다시 시작하지 않고 이어서 진행합니다.
- 토큰 효율적인 페이지 상태 — 페이지가 원시 HTML/DOM이 아닌 상호작용 요소의 인덱싱된 텍스트 형식 목록으로 표현되므로, 일반적인 자동화 출력에 비해 LLM 컨텍스트 비용이 크게 줄어듭니다.
- 3계층 안티봇 방어 — 스텔스 핑거프린트, TLS/프록시 순환, CAPTCHA 해결이 통합자가 직접 조립하도록 남겨지지 않고 CLI에 내장되어 있습니다.
- 병렬 격리 세션 — 여러 브라우저 세션과 계정이 독립적으로 동시에 실행되므로, 다중 계정 워크플로나 병렬 데이터 수집에 유용합니다.
- 클라우드 또는 로컬 실행 — 작업을 BrowserAct의 관리형 클라우드 인프라에서 설정 없이 실행하거나, 에이전트 도구 세트에 직접 통합된 로컬 Skill로 실행할 수 있습니다.
- 대부분 무료로 사용 가능 — 대부분의 명령은 가입이 필요 없거나 무료 로그인만 있으면 됩니다. 무료 티어를 초과하는 관리형 프록시와 스텔스 브라우저 세션만 유료입니다.
5. 역할별 사용 사례
일반 개발자 — 모든 안티봇 장애물에 대해 셀렉터를 직접 작성하지 않고도 실제 웹사이트를 탐색하고, 클릭하고, 데이터를 추출해야 하는 에이전트 워크플로나 스크립트를 구축합니다.
데이터/연구 과학자 — 맞춤형 스크래퍼 대신 사전 구축된 솔루션 카탈로그를 사용해 Amazon, Google Maps, Instagram 같은 플랫폼에서 구조화된 데이터(상품 리스팅, 소셜 게시물, 리뷰, 비즈니스 정보)를 수집하여 분석합니다.
프로젝트 관리자/성장 및 마케팅 팀 — 스크래핑 파이프라인을 처음부터 엔지니어링하지 않고도 경쟁 정보, 리드 목록, 콘텐츠 트렌드(LinkedIn 채용 공고, Product Hunt 출시, Reddit 토론)를 추출합니다.
6. 시작하기
필요한 것 찾기 — 대상 플랫폼을 다루는 기존 Skill이 있는지 솔루션 카탈로그를 살펴보거나, 전체 명령 레퍼런스는 문서를 확인하세요.
# docs/quick-start.md 및 저장소의 solutions/ 디렉터리 참조
설치/통합 — AI 에이전트에게 저장소에서 직접 Skill을 설치하도록 지시하세요.
Install browser-act.
Skill source: https://github.com/browser-act/skills/tree/main/browser-act
Verify it works after installation.
그런 다음 첫 명령을 실행하세요.
browser-act stealth-extract https://example.com
기여하기 — 저장소를 포크하고 solutions/ 아래에 Skill을 추가하거나 개선한 다음 풀 리퀘스트를 여세요. 새로운 플랫폼 통합과 기존 Skill에 대한 수정을 환영합니다.
7. 프로젝트 구조
skills/
├── browser-act/ # 핵심 CLI 구현
├── browser-act-skill-forge/ # 새로운 스크래핑 Skill 생성 도구
├── solutions/ # 30개 이상의 사전 구축 플랫폼 Skill 카탈로그
├── docs/ # 전체 문서(빠른 시작, 명령 레퍼런스 등)
├── assets/readme/ # README 미디어 자산
├── .github/workflows/ # CI 설정
├── requirements.txt
└── LICENSE # MIT
browser-act/에는 에이전트가 실제로 호출하는 CLI(browser-act <command>)가 들어 있습니다.browser-act-skill-forge/는 아직 카탈로그에 없는 사이트를 위한 새 Skill을 작성하는 도구입니다.solutions/는 즉시 사용 가능한 플랫폼별 Skill이 있는 곳으로, 작동하는 통합에 도달하는 가장 빠른 경로입니다.
8. 관련 생태계
- 업스트림/관리형 플랫폼:
api.browseract.com— CLI가 참조하는 호스팅 브라우저 실행, 프록시, 스텔스 세션을 지원하는 관리형 클라우드 서비스입니다. - 통합되는 에이전트 호스트: Claude Code, Cursor, VS Code 및 기타 셸 실행이 가능한 AI 에이전트.
- 보완 도구: 일반 브라우저 자동화 라이브러리(예: Playwright, Puppeteer)는 유사한 저수준 브라우저 제어를 다루지만 BrowserAct의 안티봇 계층, 에이전트 지향 인덱싱 상태, 사전 구축 Skills 카탈로그는 없습니다.
9. 라이선스
MIT 라이선스.
- ✅ 상업 및 클로즈드소스 프로젝트를 포함하여 사용, 복사, 수정, 병합, 게시, 배포가 자유롭습니다.
- ✅ 재라이선스와 비공개 수정이 허용됩니다.
- ❌ 어떠한 보증도 제공되지 않으며, 저자는 사용으로 인한 손해에 대해 책임을 지지 않습니다.
- ℹ️ 소프트웨어의 사본이나 상당 부분에는 원래 저작권 및 라이선스 고지를 유지해야 합니다.
- ℹ️ MIT 라이선스는 이 저장소의 CLI와 Skills에 적용됩니다. BrowserAct의 관리형 클라우드 서비스(무료 티어를 초과하는 프록시, 스텔스 브라우저)는 별도의 유료 서비스이며 오픈소스 라이선스의 적용을 받지 않습니다.
10. FAQ
Q: BrowserAct를 사용하려면 가입해야 하나요?
A: 대부분의 핵심 기능은 가입 없이 또는 무료 로그인만으로 작동합니다. 유료 사용은 포함된 무료 티어를 초과하는 관리형 프록시와 스텔스 브라우저 세션으로 제한됩니다.
Q: 사이트가 에이전트를 완전히 차단하면 어떻게 되나요?
A: CLI가 라이브 원격 제어 URL을 생성할 수 있으므로 사람이 어떤 기기에서든 세션을 인계받을 수 있습니다. 사람이 끝나면 에이전트가 자동으로 재개됩니다.
Q: 특정 웹사이트용 스크래퍼를 직접 작성해야 하나요?
A: 먼저 solutions/ 디렉터리를 확인하세요. 이미 30개 이상의 플랫폼(Amazon, YouTube, Google Maps, Instagram, LinkedIn 등)을 다루고 있습니다. 새로운 대상이라면 Skill Forge를 사용해 단일 탐색 세션에서 재사용 가능한 Skill을 생성하세요.
Q: 어떤 AI 에이전트가 이것을 사용할 수 있나요?
A: Claude Code, Cursor, VS Code 기반 에이전트를 포함해 셸 명령을 실행할 수 있는 모든 에이전트가 사용할 수 있습니다.
Q: 전체 명령 레퍼런스는 어디에서 찾나요?
A: 저장소의 docs/ 디렉터리를 참조하세요. docs/quick-start.md부터 시작하면 됩니다.
11. 빠른 링크
- 저장소: https://github.com/browser-act/skills
- 문서: https://docs.browseract.com
- 빠른 시작 가이드: https://github.com/browser-act/skills/blob/main/docs/quick-start.md
- 솔루션 카탈로그: https://github.com/browser-act/skills/tree/main/solutions
- 공식 웹사이트: https://browseract.com
12. 요약
BrowserAct Skills는 AI 에이전트에게 실제 웹사이트를 상대로 실제 브라우저를 운영할 수 있는 실용적이고 회복 탄력성 있는 방법을 제공합니다. 안티봇 방어, 인간 인계, 토큰 효율적인 상태까지 포함되어 있으며, 브라우저 자동화를 이미 해결된 협조적인 문제로 취급하지 않습니다. 에이전트 워크플로를 구축하는 개발자와 Amazon, YouTube, Google Maps 같은 플랫폼에서 구조화된 데이터가 필요한 데이터/연구 팀은 스크래퍼를 처음부터 작성하는 대신 30개 이상의 사전 구축 Skills에서 시작할 수 있고, Skill Forge를 사용해 새로운 사이트로 커버리지를 확장할 수 있습니다.