1. プロジェクト概要
BrowserAct Skills は、AIエージェント(Claude Code、Cursor、VS Code、その他シェル実行可能なエージェント)が実ブラウザを操作してWebタスクを完了できるようにするオープンソースのブラウザ自動化CLIです。アンチボットシステムで保護されたサイトにも対応し、エージェントが行き詰まった場合は人間のオペレーターに引き継ぐことができます。
2. 背景と位置づけ
ほとんどのブラウザ自動化フレームワークは、CAPTCHAもフィンガープリンティングもログインウォールもない、クリーンで協調的なWebを前提としています。しかし実際には、現実のサイトを閲覧・検索・データ抽出しようとするAIエージェントは、アンチボット防御、地域制限、アカウント限定コンテンツに絶えず直面し、素朴な自動化は機能しません。BrowserActはこのギャップを埋めるために作られました。「エージェントはいずれブロックされる」ことを例外ではなく標準ケースとして扱い、その前提で設計されています。
その中核的な使命は、エージェントにライブWebへの耐障害性が高くトークン効率の良いインターフェースを提供し、組み込みの脱出手段を備えることです。自動化が本当に続行できない場合、ライブのリモートコントロールURLを通じて人間に制御を引き継ぎ、人間の作業が完了するとエージェントが自動的に再開します。
汎用ブラウザ自動化ライブラリ(PlaywrightやPuppeteerのラッパーなど)と比較して、BrowserActは3つの点で異なります。
- 回避策を完全に呼び出し側に委ねるのではなく、3層のアンチボット戦略(環境、実行、人間)を標準装備しています。
- 生のDOM/HTML/JSONではなく、インデックス付きのテキストベースのページ状態を返します。これによりLLMトークンが大幅に節約され、エージェントが推論しやすくなります。
- 人気プラットフォーム(Amazon、YouTube、Google Maps、Instagramなど)向けの30以上の既製スキルのカタログを同梱しているため、一般的なスクレイピングタスクで自動化をゼロから書く必要がありません。
3. 機能カテゴリ
🛡️ アンチボット保護(3層アプローチ) — 防御されたサイトに対して自動化を継続させるための仕組み。
- ボット検出シグネチャを回避するステルスブラウザフィンガープリンティング
- TLSフィンガープリントのローテーション
- IP多様性のためのプロキシローテーション
- 自動CAPTCHA解決
- 自動化が完全にブロックされた場合のライブ人間引き継ぎURL
目的:サイトが自動アクセスに積極的に抵抗する場合でも、長時間実行や機密性の高いタスクを維持する。
🌐 ブラウザモード — タスクに応じた異なるセッションID。
- Chromeモード(ローカルブラウザの既存ログイン状態を再利用)
- ステルスプライバシーモード(セッションごとに新規で関連付け不能なフィンガープリント)
- ステルス固定IDモード(セッション間で永続的なフィンガープリント/アカウント)
目的:自動化のIDをタスクに合わせる — ログイン済みワークフロー、匿名スクレイピング、一貫した長期アカウント。
🤖 エージェント最適化インタラクション — エージェントが直接呼び出す中核CLIプリミティブ。
- 生のセレクタではなくインデックス付きインタラクション(
click 3、input 5 "text") - コンパクトでトークン効率の良いテキスト状態出力
- タスク間の干渉なしのマルチセッション・マルチブラウザ並行実行
目的:人間のスクリプトだけでなく、LLM駆動エージェントにとってブラウザ制御を安価で信頼できるものにする。
📦 ソリューションカタログ(30以上の既製スキル) — 一般的な対象向けのすぐに使える自動化。
- Amazon、eBay、Etsy、Walmart(商品/出品/レビュー抽出)
- YouTube、TikTok、Instagram、X/Twitter(コンテンツ、コメント、プロフィールデータ)
- Google Maps、LinkedIn、Indeed(リード、ビジネス情報、求人情報)
- Reddit、小紅書(Xiaohongshu)、抖音(Douyin)、知乎(Zhihu)、WeChat(地域プラットフォーム対応)
目的:コミュニティが既にカバーしているプラットフォームのスクレイパー再実装を省略する。
🛠️ スキルフォージ — 新しいスキルを生成する補助ツール。
- 対象サイトを一度探索し、再利用可能で展開可能なスクレイピングスキルを生成する
目的:一度きりの手動探索を、繰り返し使えて共有可能な自動化資産に変える。
4. 主なハイライト
- 状態を失わない人間への引き継ぎ — エージェントが壁にぶつかったとき(CAPTCHA、2要素認証、手動確認)、ライブのリモートコントロールリンクを生成できます。人間が任意のデバイスから引き継ぎ、その後エージェントは再起動せずにセッションを再開します。
- トークン効率の良いページ状態 — ページは生のHTML/DOMではなく、インタラクティブ要素のインデックス付きテキスト形式リストとして表現されるため、一般的な自動化出力と比べてLLMコンテキストコストを大幅に削減します。
- 3層のアンチボット防御 — ステルスフィンガープリント、TLS/プロキシローテーション、CAPTCHA解決がCLIに組み込まれており、インテグレーターが組み立てる必要はありません。
- 並行・分離セッション — 複数の同時ブラウザセッションとアカウントが独立して実行され、マルチアカウントワークフローや並行データ収集に役立ちます。
- クラウドまたはローカル実行 — タスクはセットアップ不要でBrowserActのマネージドクラウドインフラ上で実行するか、エージェントのツールセットに直接統合されたローカルスキルとして実行できます。
- ほぼ無料で利用可能 — ほとんどのコマンドはサインアップ不要か、無料ログインのみで利用できます。有料なのは、無料枠を超えるマネージドプロキシとステルスブラウザセッションのみです。
5. 役割別ユースケース
一般開発者 — 実際のWebサイトを閲覧・クリック操作・データ抽出する必要があるエージェントワークフローやスクリプトを、アンチボット障害ごとにセレクタを手書きすることなく構築できます。
データ/リサーチサイエンティスト — Amazon、Google Maps、Instagramなどのプラットフォームから構造化データ(商品リスト、ソーシャル投稿、レビュー、ビジネス情報)を収集し、カスタムスクレイパーの代わりに既製のソリューションカタログを使って分析できます。
プロジェクトマネージャー/グロース・マーケティングチーム — 競合情報、リードリスト、コンテンツトレンド(LinkedInの求人、Product Huntのローンチ、Redditの議論)を、スクレイピングパイプラインをゼロから構築することなく抽出できます。
6. はじめに
必要なものを見つける — 対象プラットフォームをカバーする既存スキルをソリューションカタログで探すか、完全なコマンドリファレンスをドキュメントで確認してください。
# docs/quick-start.md とリポジトリ内の solutions/ ディレクトリを参照
インストール/統合 — AIエージェントにリポジトリから直接スキルをインストールするよう指示します。
Install browser-act.
Skill source: https://github.com/browser-act/skills/tree/main/browser-act
Verify it works after installation.
その後、最初のコマンドを実行します。
browser-act stealth-extract https://example.com
貢献 — リポジトリをフォークし、solutions/ の下にスキルを追加または改善してプルリクエストを開いてください。新しいプラットフォーム統合や既存スキルの修正を歓迎します。
7. プロジェクト構造
skills/
├── browser-act/ # 中核CLI実装
├── browser-act-skill-forge/ # 新しいスクレイピングスキル生成ツール
├── solutions/ # 30以上の既製プラットフォームスキルのカタログ
├── docs/ # 完全なドキュメント(クイックスタート、コマンドリファレンスなど)
├── assets/readme/ # READMEメディアアセット
├── .github/workflows/ # CI設定
├── requirements.txt
└── LICENSE # MIT
browser-act/には、エージェントが実際に呼び出すCLI(browser-act <command>)が含まれています。browser-act-skill-forge/は、カタログにまだないサイト向けの新しいスキルを作成するためのツールです。solutions/は、既製のプラットフォーム固有スキルが置かれる場所で、動作する統合への最速の道です。
8. 関連エコシステム
- 上流/マネージドプラットフォーム:
api.browseract.com— CLIが参照するホスト型ブラウザ実行、プロキシ、ステルスセッションを支えるマネージドクラウドサービス。 - 統合対象のエージェントホスト: Claude Code、Cursor、VS Code、その他シェル実行可能なAIエージェント。
- 補完ツール: 汎用ブラウザ自動化ライブラリ(Playwright、Puppeteerなど)は同様の低レベルブラウザ制御を扱いますが、BrowserActのアンチボット層、エージェント指向のインデックス付き状態、既製スキルカタログはありません。
9. ライセンス
MITライセンス。
- ✅ 商用・クローズドソースプロジェクトを含め、使用、複製、改変、統合、公開、配布が自由です。
- ✅ サブライセンスと非公開の改変が許可されています。
- ❌ 保証は提供されません。作者は使用に起因する損害について責任を負いません。
- ℹ️ ソフトウェアの複製または実質的部分には、元の著作権表示とライセンス通知を保持する必要があります。
- ℹ️ MITライセンスはこのリポジトリ内のCLIとスキルを対象としています。BrowserActのマネージドクラウドサービス(無料枠を超えるプロキシ、ステルスブラウザ)は別の有料サービスであり、オープンソースライセンスの対象外です。
10. よくある質問
Q: BrowserActを使うにはサインアップが必要ですか?
A: ほとんどのコア機能はサインアップなし、または無料ログインのみで動作します。有料利用は、付属の無料枠を超えるマネージドプロキシとステルスブラウザセッションに限定されます。
Q: サイトがエージェントを完全にブロックした場合はどうなりますか?
A: CLIがライブのリモートコントロールURLを生成し、人間が任意のデバイスからセッションを引き継げます。人間が完了すると、エージェントが自動的に再開します。
Q: 特定のWebサイト用に自分でスクレイパーを書く必要がありますか?
A: まず solutions/ ディレクトリを確認してください。既に30以上のプラットフォーム(Amazon、YouTube、Google Maps、Instagram、LinkedInなど)をカバーしています。新しい対象の場合は、スキルフォージを使って1回の探索セッションから再利用可能なスキルを生成できます。
Q: どのAIエージェントがこれを使えますか?
A: Claude Code、Cursor、VS Codeベースのエージェントを含む、シェルコマンドを実行できる任意のエージェントです。
Q: 完全なコマンドリファレンスはどこにありますか?
A: リポジトリの docs/ ディレクトリを参照してください。まずは docs/quick-start.md から始めてください。
11. クイックリンク
- リポジトリ: https://github.com/browser-act/skills
- ドキュメント: https://docs.browseract.com
- クイックスタートガイド: https://github.com/browser-act/skills/blob/main/docs/quick-start.md
- ソリューションカタログ: https://github.com/browser-act/skills/tree/main/solutions
- 公式Webサイト: https://browseract.com
12. まとめ
BrowserAct Skillsは、AIエージェントに実ブラウザを実Webサイトに対して操作する実用的で耐障害性の高い方法を提供します。アンチボット防御、人間への引き継ぎ、トークン効率の良い状態表現を備えており、ブラウザ自動化を解決済みの協調的な問題として扱いません。エージェントワークフローを構築する開発者や、Amazon、YouTube、Google Mapsなどのプラットフォームから構造化データを必要とするデータ/リサーチチームは、スクレイパーをゼロから書く代わりに30以上の既製スキルから始められ、スキルフォージを使って新しいサイトへカバレッジを拡張できます。