skills

開源 CLI,讓 AI 代理控制真實瀏覽器、繞過反機器人防禦,並在卡住時交給人類接手。

PythonMITCrawler
⭐ GitHubhttps://github.com/browser-act/skills
5,500
Star 數
+0
Star 增速
2026年8月24日
最後更新
2
點擊數

1. 專案概述

BrowserAct Skills 是一款開源瀏覽器自動化 CLI,可讓 AI 代理(Claude Code、Cursor、VS Code 及其他具備 shell 執行能力的代理)驅動真實瀏覽器完成網頁任務——包括受反機器人系統保護的網站——並在代理卡住時交給人類操作員接手。

2. 背景與定位

大多數瀏覽器自動化框架都假設一個乾淨、合作的網路環境:沒有 CAPTCHA、沒有指紋追蹤、沒有登入牆。但在實務上,嘗試瀏覽、搜尋或從真實網站擷取資料的 AI 代理,會不斷遇到反機器人防禦、地理限制和帳號門檻內容,讓天真的自動化方案失效。BrowserAct 正是為了彌補這個落差而打造——它把「代理最終會被封鎖」視為預設情況,而非例外,並以此為核心進行設計。

其核心使命是提供代理一個具韌性、節省 token 的即時網路介面,並內建逃生通道:當自動化真的無法繼續時,可透過即時遠端控制網址將控制權交給人類,人類完成後代理會自動恢復作業。

與通用瀏覽器自動化函式庫(例如 Playwright/Puppeteer 的封裝)相比,BrowserAct 有三點不同:

  • 它內建三層反機器人策略(環境、執行、人類),而不是把規避責任完全丟給呼叫方。
  • 它回傳已建立索引、以文字為基礎的頁面狀態,而非原始 DOM/HTML/JSON,這在 LLM token 成本上便宜得多,代理也更容易理解。
  • 它隨附超過 30 個現成 Skills 目錄,涵蓋熱門平台(Amazon、YouTube、Google Maps、Instagram 等),因此常見的爬蟲任務不需要從零撰寫自動化程式。

3. 功能分類

🛡️ 反機器人防護(三層策略) — 讓自動化在面對防禦性網站時仍能持續運作的機制。

  • 隱身瀏覽器指紋,避免機器人偵測特徵
  • TLS 指紋輪換
  • 代理輪換以實現 IP 多樣性
  • 自動 CAPTCHA 解題
  • 當自動化被完全封鎖時,提供即時人類接管網址

目的:即使網站積極抵抗自動化存取,也能讓長時間執行或敏感的任務持續運作。

🌐 瀏覽器模式 — 依任務需求使用不同的工作階段身分。

  • Chrome 模式(重複使用本機瀏覽器現有的登入狀態)
  • 隱身隱私模式(每個工作階段使用全新、無法關聯的指紋)
  • 隱身固定身分模式(跨工作階段維持固定的指紋/帳號)

目的:讓自動化身分與任務匹配——登入工作流程、匿名爬蟲,或長期一致帳號。

🤖 代理最佳化互動 — 代理直接呼叫的核心 CLI 原語。

  • 以索引互動(click 3input 5 "text")取代原始選擇器
  • 精簡、節省 token 的文字狀態輸出
  • 多工作階段、多瀏覽器並行,且無跨任務干擾

目的:讓瀏覽器控制對 LLM 驅動的代理而言既便宜又可靠,而不只是給人類腳本使用。

📦 解決方案目錄(超過 30 個預建 Skills) — 針對常見目標的現成自動化方案。

  • Amazon、eBay、Etsy、Walmart(商品/刊登/評論擷取)
  • YouTube、TikTok、Instagram、X/Twitter(內容、留言、個人資料資料)
  • Google Maps、LinkedIn、Indeed(潛在客戶、商家資訊、職缺列表)
  • Reddit、小紅書、抖音、知乎、微信(區域平台涵蓋)

目的:社群已涵蓋的平台,不必重新實作爬蟲。

🛠️ Skill Forge — 用於產生新 Skills 的輔助工具。

  • 探索目標網站一次,然後產出可重複使用、可部署的爬蟲 Skill

目的:將一次性的人工探索轉化為可重複、可分享的自動化資產。

4. 重點特色

  • 人類接手而不遺失狀態 — 當代理遇到障礙(CAPTCHA、2FA、人工驗證)時,可產生即時遠端控制連結;人類可從任何裝置接手,代理之後會恢復該工作階段,而不是重新開始。
  • 節省 token 的頁面狀態 — 頁面以已建立索引、文字格式的互動元素列表呈現,而非原始 HTML/DOM,相較於一般自動化輸出,可大幅降低 LLM 脈絡成本。
  • 三層反機器人防禦 — 隱身指紋、TLS/代理輪換和 CAPTCHA 解題都內建於 CLI,而不是留給整合者自行組裝。
  • 平行且隔離的工作階段 — 多個並行瀏覽器工作階段和帳號獨立運作,適用於多帳號工作流程或平行資料收集。
  • 雲端或本機執行 — 任務可在 BrowserAct 的託管雲端基礎架構上免設定執行,或作為本機 Skills 直接整合進代理的工具集。
  • 大部分功能免費使用 — 多數指令無需註冊或僅需免費登入;只有超出免費額度的託管代理和隱身瀏覽器工作階段才需付費。

5. 依角色區分的使用案例

一般開發者 — 建構需要瀏覽、點擊操作並從真實網站擷取資料的代理工作流程或腳本,不必為每個反機器人障礙手寫選擇器。

資料/研究科學家 — 使用預建的解決方案目錄,從 Amazon、Google Maps 或 Instagram 等平台收集結構化資料(商品列表、社群貼文、評論、商家資訊)進行分析,而不必自訂爬蟲。

專案經理/成長與行銷團隊 — 擷取競爭情報、潛在客戶名單或內容趨勢(LinkedIn 職缺、Product Hunt 發表、Reddit 討論),不必從零打造爬蟲管線。

6. 快速入門

找到你需要的東西 — 瀏覽解決方案目錄,尋找涵蓋你目標平台的現有 Skill,或查閱文件以取得完整指令參考:

# 請參閱 docs/quick-start.md 和儲存庫中的 solutions/ 目錄

安裝/整合 — 告訴你的 AI 代理直接從儲存庫安裝 Skill:

Install browser-act.
Skill source: https://github.com/browser-act/skills/tree/main/browser-act
Verify it works after installation.

然後執行第一個指令:

browser-act stealth-extract https://example.com

貢獻 — fork 儲存庫,在 solutions/ 下新增或改進 Skill,然後開啟 pull request;歡迎新的平台整合和對現有 Skill 的修正。

7. 專案結構

skills/
├── browser-act/               # 核心 CLI 實作
├── browser-act-skill-forge/    # 用於產生新爬蟲 Skills 的工具
├── solutions/                  # 超過 30 個預建平台 Skills 目錄
├── docs/                       # 完整文件(快速入門、指令參考等)
├── assets/readme/               # README 媒體素材
├── .github/workflows/           # CI 設定
├── requirements.txt
└── LICENSE                      # MIT
  • browser-act/ 包含代理實際呼叫的 CLI(browser-act <command>)。
  • browser-act-skill-forge/ 是用來為目錄中尚未涵蓋的網站撰寫新 Skills 的工具。
  • solutions/ 是現成、平台專屬 Skills 的所在位置——通往可用整合的最快路徑。

8. 相關生態系

  • 上游/託管平台api.browseract.com — 託管雲端服務,提供 CLI 所引用的代管瀏覽器執行、代理和隱身工作階段。
  • 整合的代理主機:Claude Code、Cursor、VS Code,以及其他具備 shell 執行能力的 AI 代理。
  • 互補工具:通用瀏覽器自動化函式庫(例如 Playwright、Puppeteer)處理類似的低階瀏覽器控制,但沒有 BrowserAct 的反機器人層、代理導向的索引狀態或預建 Skills 目錄。

9. 授權條款

MIT 授權條款。

  • ✅ 可自由使用、複製、修改、合併、發布和散布,包括用於商業和封閉原始碼專案。
  • ✅ 允許再授權和私人修改。
  • ❌ 不提供任何保固;作者不對因使用而產生的損害負責。
  • ℹ️ 在軟體的副本或實質部分中,必須保留原始版權和授權聲明。
  • ℹ️ MIT 授權涵蓋本儲存庫中的 CLI 和 Skills;BrowserAct 的託管雲端服務(代理、超出免費額度的隱身瀏覽器)是另外的付費服務,不在開源授權涵蓋範圍內。

10. 常見問題

問:使用 BrowserAct 需要註冊嗎?
答:多數核心功能無需註冊或僅需免費登入即可使用。付費使用僅限於託管代理和超出免費額度的隱身瀏覽器工作階段。

問:當網站完全封鎖代理時會發生什麼事?
答:CLI 可產生即時遠端控制網址,讓人類可從任何裝置接手工作階段;人類完成後,代理會自動恢復。

問:我必須為特定網站撰寫自己的爬蟲嗎?
答:請先查看 solutions/ 目錄——它已涵蓋超過 30 個平台(Amazon、YouTube、Google Maps、Instagram、LinkedIn 等)。對於新目標,可使用 Skill Forge 從單次探索工作階段產生可重複使用的 Skill。

問:哪些 AI 代理可以使用?
答:任何能執行 shell 指令的代理都可以,包括 Claude Code、Cursor 和基於 VS Code 的代理。

問:在哪裡可以找到完整指令參考?
答:請參閱儲存庫中的 docs/ 目錄,從 docs/quick-start.md 開始。

11. 快速連結

12. 總結

BrowserAct Skills 為 AI 代理提供一種實用且具韌性的方式,在真實網站上操作真實瀏覽器——內含反機器人防禦、人類接手和節省 token 的狀態——而不是把瀏覽器自動化當成一個已解決的、合作的問題。建構代理工作流程的開發者,以及需要從 Amazon、YouTube 或 Google Maps 等平台取得結構化資料的資料/研究團隊,可以從超過 30 個預建 Skills 開始,而不必從零撰寫爬蟲,並使用 Skill Forge 將涵蓋範圍擴展到新網站。