1. 專案概述
BrowserAct Skills 是一款開源瀏覽器自動化 CLI,可讓 AI 代理(Claude Code、Cursor、VS Code 及其他具備 shell 執行能力的代理)驅動真實瀏覽器完成網頁任務——包括受反機器人系統保護的網站——並在代理卡住時交給人類操作員接手。
2. 背景與定位
大多數瀏覽器自動化框架都假設一個乾淨、合作的網路環境:沒有 CAPTCHA、沒有指紋追蹤、沒有登入牆。但在實務上,嘗試瀏覽、搜尋或從真實網站擷取資料的 AI 代理,會不斷遇到反機器人防禦、地理限制和帳號門檻內容,讓天真的自動化方案失效。BrowserAct 正是為了彌補這個落差而打造——它把「代理最終會被封鎖」視為預設情況,而非例外,並以此為核心進行設計。
其核心使命是提供代理一個具韌性、節省 token 的即時網路介面,並內建逃生通道:當自動化真的無法繼續時,可透過即時遠端控制網址將控制權交給人類,人類完成後代理會自動恢復作業。
與通用瀏覽器自動化函式庫(例如 Playwright/Puppeteer 的封裝)相比,BrowserAct 有三點不同:
- 它內建三層反機器人策略(環境、執行、人類),而不是把規避責任完全丟給呼叫方。
- 它回傳已建立索引、以文字為基礎的頁面狀態,而非原始 DOM/HTML/JSON,這在 LLM token 成本上便宜得多,代理也更容易理解。
- 它隨附超過 30 個現成 Skills 目錄,涵蓋熱門平台(Amazon、YouTube、Google Maps、Instagram 等),因此常見的爬蟲任務不需要從零撰寫自動化程式。
3. 功能分類
🛡️ 反機器人防護(三層策略) — 讓自動化在面對防禦性網站時仍能持續運作的機制。
- 隱身瀏覽器指紋,避免機器人偵測特徵
- TLS 指紋輪換
- 代理輪換以實現 IP 多樣性
- 自動 CAPTCHA 解題
- 當自動化被完全封鎖時,提供即時人類接管網址
目的:即使網站積極抵抗自動化存取,也能讓長時間執行或敏感的任務持續運作。
🌐 瀏覽器模式 — 依任務需求使用不同的工作階段身分。
- Chrome 模式(重複使用本機瀏覽器現有的登入狀態)
- 隱身隱私模式(每個工作階段使用全新、無法關聯的指紋)
- 隱身固定身分模式(跨工作階段維持固定的指紋/帳號)
目的:讓自動化身分與任務匹配——登入工作流程、匿名爬蟲,或長期一致帳號。
🤖 代理最佳化互動 — 代理直接呼叫的核心 CLI 原語。
- 以索引互動(
click 3、input 5 "text")取代原始選擇器 - 精簡、節省 token 的文字狀態輸出
- 多工作階段、多瀏覽器並行,且無跨任務干擾
目的:讓瀏覽器控制對 LLM 驅動的代理而言既便宜又可靠,而不只是給人類腳本使用。
📦 解決方案目錄(超過 30 個預建 Skills) — 針對常見目標的現成自動化方案。
- Amazon、eBay、Etsy、Walmart(商品/刊登/評論擷取)
- YouTube、TikTok、Instagram、X/Twitter(內容、留言、個人資料資料)
- Google Maps、LinkedIn、Indeed(潛在客戶、商家資訊、職缺列表)
- Reddit、小紅書、抖音、知乎、微信(區域平台涵蓋)
目的:社群已涵蓋的平台,不必重新實作爬蟲。
🛠️ Skill Forge — 用於產生新 Skills 的輔助工具。
- 探索目標網站一次,然後產出可重複使用、可部署的爬蟲 Skill
目的:將一次性的人工探索轉化為可重複、可分享的自動化資產。
4. 重點特色
- 人類接手而不遺失狀態 — 當代理遇到障礙(CAPTCHA、2FA、人工驗證)時,可產生即時遠端控制連結;人類可從任何裝置接手,代理之後會恢復該工作階段,而不是重新開始。
- 節省 token 的頁面狀態 — 頁面以已建立索引、文字格式的互動元素列表呈現,而非原始 HTML/DOM,相較於一般自動化輸出,可大幅降低 LLM 脈絡成本。
- 三層反機器人防禦 — 隱身指紋、TLS/代理輪換和 CAPTCHA 解題都內建於 CLI,而不是留給整合者自行組裝。
- 平行且隔離的工作階段 — 多個並行瀏覽器工作階段和帳號獨立運作,適用於多帳號工作流程或平行資料收集。
- 雲端或本機執行 — 任務可在 BrowserAct 的託管雲端基礎架構上免設定執行,或作為本機 Skills 直接整合進代理的工具集。
- 大部分功能免費使用 — 多數指令無需註冊或僅需免費登入;只有超出免費額度的託管代理和隱身瀏覽器工作階段才需付費。
5. 依角色區分的使用案例
一般開發者 — 建構需要瀏覽、點擊操作並從真實網站擷取資料的代理工作流程或腳本,不必為每個反機器人障礙手寫選擇器。
資料/研究科學家 — 使用預建的解決方案目錄,從 Amazon、Google Maps 或 Instagram 等平台收集結構化資料(商品列表、社群貼文、評論、商家資訊)進行分析,而不必自訂爬蟲。
專案經理/成長與行銷團隊 — 擷取競爭情報、潛在客戶名單或內容趨勢(LinkedIn 職缺、Product Hunt 發表、Reddit 討論),不必從零打造爬蟲管線。
6. 快速入門
找到你需要的東西 — 瀏覽解決方案目錄,尋找涵蓋你目標平台的現有 Skill,或查閱文件以取得完整指令參考:
# 請參閱 docs/quick-start.md 和儲存庫中的 solutions/ 目錄
安裝/整合 — 告訴你的 AI 代理直接從儲存庫安裝 Skill:
Install browser-act.
Skill source: https://github.com/browser-act/skills/tree/main/browser-act
Verify it works after installation.
然後執行第一個指令:
browser-act stealth-extract https://example.com
貢獻 — fork 儲存庫,在 solutions/ 下新增或改進 Skill,然後開啟 pull request;歡迎新的平台整合和對現有 Skill 的修正。
7. 專案結構
skills/
├── browser-act/ # 核心 CLI 實作
├── browser-act-skill-forge/ # 用於產生新爬蟲 Skills 的工具
├── solutions/ # 超過 30 個預建平台 Skills 目錄
├── docs/ # 完整文件(快速入門、指令參考等)
├── assets/readme/ # README 媒體素材
├── .github/workflows/ # CI 設定
├── requirements.txt
└── LICENSE # MIT
browser-act/包含代理實際呼叫的 CLI(browser-act <command>)。browser-act-skill-forge/是用來為目錄中尚未涵蓋的網站撰寫新 Skills 的工具。solutions/是現成、平台專屬 Skills 的所在位置——通往可用整合的最快路徑。
8. 相關生態系
- 上游/託管平台:
api.browseract.com— 託管雲端服務,提供 CLI 所引用的代管瀏覽器執行、代理和隱身工作階段。 - 整合的代理主機:Claude Code、Cursor、VS Code,以及其他具備 shell 執行能力的 AI 代理。
- 互補工具:通用瀏覽器自動化函式庫(例如 Playwright、Puppeteer)處理類似的低階瀏覽器控制,但沒有 BrowserAct 的反機器人層、代理導向的索引狀態或預建 Skills 目錄。
9. 授權條款
MIT 授權條款。
- ✅ 可自由使用、複製、修改、合併、發布和散布,包括用於商業和封閉原始碼專案。
- ✅ 允許再授權和私人修改。
- ❌ 不提供任何保固;作者不對因使用而產生的損害負責。
- ℹ️ 在軟體的副本或實質部分中,必須保留原始版權和授權聲明。
- ℹ️ MIT 授權涵蓋本儲存庫中的 CLI 和 Skills;BrowserAct 的託管雲端服務(代理、超出免費額度的隱身瀏覽器)是另外的付費服務,不在開源授權涵蓋範圍內。
10. 常見問題
問:使用 BrowserAct 需要註冊嗎?
答:多數核心功能無需註冊或僅需免費登入即可使用。付費使用僅限於託管代理和超出免費額度的隱身瀏覽器工作階段。
問:當網站完全封鎖代理時會發生什麼事?
答:CLI 可產生即時遠端控制網址,讓人類可從任何裝置接手工作階段;人類完成後,代理會自動恢復。
問:我必須為特定網站撰寫自己的爬蟲嗎?
答:請先查看 solutions/ 目錄——它已涵蓋超過 30 個平台(Amazon、YouTube、Google Maps、Instagram、LinkedIn 等)。對於新目標,可使用 Skill Forge 從單次探索工作階段產生可重複使用的 Skill。
問:哪些 AI 代理可以使用?
答:任何能執行 shell 指令的代理都可以,包括 Claude Code、Cursor 和基於 VS Code 的代理。
問:在哪裡可以找到完整指令參考?
答:請參閱儲存庫中的 docs/ 目錄,從 docs/quick-start.md 開始。
11. 快速連結
- 儲存庫:https://github.com/browser-act/skills
- 文件:https://docs.browseract.com
- 快速入門指南:https://github.com/browser-act/skills/blob/main/docs/quick-start.md
- 解決方案目錄:https://github.com/browser-act/skills/tree/main/solutions
- 官方網站:https://browseract.com
12. 總結
BrowserAct Skills 為 AI 代理提供一種實用且具韌性的方式,在真實網站上操作真實瀏覽器——內含反機器人防禦、人類接手和節省 token 的狀態——而不是把瀏覽器自動化當成一個已解決的、合作的問題。建構代理工作流程的開發者,以及需要從 Amazon、YouTube 或 Google Maps 等平台取得結構化資料的資料/研究團隊,可以從超過 30 個預建 Skills 開始,而不必從零撰寫爬蟲,並使用 Skill Forge 將涵蓋範圍擴展到新網站。