1. 项目概述
BrowserAct Skills 是一个开源浏览器自动化 CLI,可让 AI 智能体(Claude Code、Cursor、VS Code 及其他具备 shell 能力的智能体)驱动真实浏览器完成网页任务——包括受反机器人系统保护的站点——并在智能体卡住时将控制权转交给人类操作员。
2. 背景与定位
大多数浏览器自动化框架都假设面对的是一个干净、配合的网络环境:没有验证码、没有指纹识别、没有登录墙。但在实践中,尝试浏览、搜索或从真实网站提取数据的 AI 智能体,会不断遭遇反机器人防御、地理限制和账号门槛,这些都会让简单的自动化方案失效。BrowserAct 正是为了弥合这一差距而构建的——它将“智能体最终会被拦截”视为默认情况而非例外,并围绕这一点进行设计。
其核心使命是为智能体提供一个对活跃网络具有韧性且节省 token 的接口,并内置一个逃生通道:当自动化确实无法继续时,可以通过一个实时远程控制链接将控制权交给人类,人类完成后智能体会自动恢复运行。
与通用浏览器自动化库(如 Playwright/Puppeteer 的封装)相比,BrowserAct 在三个方面有所不同:
- 它提供了一套三层反机器人策略(环境、执行、人工),而不是把规避工作完全留给调用方。
- 它返回的是带索引的、基于文本的页面状态,而非原始 DOM/HTML/JSON,这在 LLM token 消耗上要便宜得多,也更便于智能体进行推理。
- 它捆绑了30 多个现成 Skills 的目录,覆盖热门平台(Amazon、YouTube、Google Maps、Instagram 等),因此常见的抓取任务无需从头编写自动化代码。
3. 功能分类
🛡️ 反机器人防护(三层方案)——让自动化在面对有防御的站点时仍能持续运行的机制。
- 隐身浏览器指纹识别,避免被机器人检测特征标记
- TLS 指纹轮换
- 代理轮换以实现 IP 多样性
- 自动验证码识别
- 当自动化被完全拦截时,提供实时人工接管链接
目的:即使站点主动抵抗自动化访问,也能让长时间运行或敏感任务保持存活。
🌐 浏览器模式——根据任务需要提供不同的会话身份。
- Chrome 模式(复用本地浏览器已有的登录状态)
- 隐身隐私模式(每个会话使用全新、不可关联的指纹)
- 隐身固定身份模式(跨会话保持持久指纹/账号)
目的:让自动化身份与任务相匹配——登录工作流、匿名抓取或长期一致的账号。
🤖 面向智能体优化的交互——智能体直接调用的核心 CLI 原语。
- 带索引的交互(
click 3、input 5 "text"),而非原始选择器 - 紧凑、节省 token 的文本状态输出
- 多会话、多浏览器并发,且无跨任务干扰
目的:让浏览器控制对 LLM 驱动的智能体来说既便宜又可靠,而不仅仅是供人类脚本使用。
📦 解决方案目录(30 多个预构建 Skills)——针对常见目标平台的即用型自动化。
- Amazon、eBay、Etsy、Walmart(商品/列表/评论提取)
- YouTube、TikTok、Instagram、X/Twitter(内容、评论、个人资料数据)
- Google Maps、LinkedIn、Indeed(销售线索、商家信息、职位列表)
- Reddit、小红书、抖音、知乎、微信(区域平台覆盖)
目的:对于社区已经覆盖的平台,无需重新实现抓取器。
🛠️ Skill Forge——一个用于生成新 Skills 的配套工具。
- 对目标站点进行一次探索,然后生成一个可复用、可部署的抓取 Skill
目的:将一次性的手动探索转化为可重复、可共享的自动化资产。
4. 核心亮点
- 不丢失状态的人工交接——当智能体遇到障碍(验证码、双重认证、人工验证)时,它可以生成一个实时远程控制链接;人类可以从任何设备接管,之后智能体会恢复该会话,而不是重新开始。
- 节省 token 的页面状态——页面以带索引的、文本格式的可交互元素列表呈现,而非原始 HTML/DOM,与典型自动化输出相比,显著降低了 LLM 上下文成本。
- 三层反机器人防御——隐身指纹、TLS/代理轮换和验证码识别内置于 CLI 中,而不是留给集成方自行拼装。
- 并行且隔离的会话——多个并发浏览器会话和账号独立运行,适用于多账号工作流或并行数据采集。
- 云端或本地执行——任务可以在 BrowserAct 的托管云基础设施上运行,无需任何设置;也可以作为本地 Skills 直接集成到智能体的工具集中。
- 大部分功能免费使用——大多数命令无需注册或仅需免费登录;只有超出免费额度的托管代理和隐身浏览器会话需要付费。
5. 按角色的使用场景
普通开发者——构建需要浏览、点击并从真实网站提取数据的智能体工作流或脚本,而无需为每一个反机器人障碍手写选择器。
数据/研究科学家——使用预构建的解决方案目录(而非自定义抓取器),从 Amazon、Google Maps 或 Instagram 等平台采集结构化数据(商品列表、社交帖子、评论、商家信息)用于分析。
项目经理/增长与营销团队——提取竞争情报、销售线索列表或内容趋势(LinkedIn 职位、Product Hunt 发布、Reddit 讨论),而无需从零搭建抓取流水线。
6. 快速上手
找到你需要的——浏览解决方案目录,寻找覆盖你目标平台的现有 Skill,或查看文档获取完整命令参考:
# 参见 docs/quick-start.md 以及仓库中的 solutions/ 目录
安装/集成——告诉你的 AI 智能体直接从仓库安装该 Skill:
安装 browser-act。
Skill 来源:https://github.com/browser-act/skills/tree/main/browser-act
安装后验证其是否正常工作。
然后运行第一条命令:
browser-act stealth-extract https://example.com
参与贡献——fork 该仓库,在 solutions/ 下添加或改进某个 Skill,然后提交 pull request;欢迎新的平台集成以及对现有 Skills 的修复。
7. 项目结构
skills/
├── browser-act/ # 核心 CLI 实现
├── browser-act-skill-forge/ # 用于生成新抓取 Skills 的工具
├── solutions/ # 30 多个预构建平台 Skills 的目录
├── docs/ # 完整文档(快速上手、命令参考等)
├── assets/readme/ # README 媒体资源
├── .github/workflows/ # CI 配置
├── requirements.txt
└── LICENSE # MIT
browser-act/包含智能体实际调用的 CLI(browser-act <command>)。browser-act-skill-forge/是用于为目录中尚未覆盖的站点编写新 Skills 的工具。solutions/存放现成的、针对特定平台的 Skills——这是实现可用集成的最快路径。
8. 相关生态
- 上游/托管平台:
api.browseract.com——托管云服务,为 CLI 所引用的托管浏览器执行、代理和隐身会话提供支持。 - 可集成的智能体宿主:Claude Code、Cursor、VS Code 以及其他具备 shell 执行能力的 AI 智能体。
- 互补工具:通用浏览器自动化库(如 Playwright、Puppeteer)解决类似的底层浏览器控制问题,但不具备 BrowserAct 的反机器人层、面向智能体的索引状态或预构建 Skills 目录。
9. 许可证
MIT 许可证。
- ✅ 可自由使用、复制、修改、合并、发布和分发,包括用于商业和闭源项目。
- ✅ 允许再许可和私有修改。
- ❌ 不提供任何担保;作者对因使用而产生的损害不承担责任。
- ℹ️ 在副本或软件的实质性部分中必须保留原始版权和许可证声明。
- ℹ️ MIT 许可证涵盖本仓库中的 CLI 和 Skills;BrowserAct 的托管云服务(超出免费额度的代理、隐身浏览器)是单独的付费产品,不在开源许可证覆盖范围内。
10. 常见问题
问:使用 BrowserAct 需要注册吗?
答:大多数核心功能无需注册或仅需免费登录即可使用。付费使用仅限于超出免费额度的托管代理和隐身浏览器会话。
问:当站点完全拦截智能体时会发生什么?
答:CLI 可以生成一个实时远程控制链接,让人类可以从任何设备接管会话;人类完成后,智能体会自动恢复运行。
问:我必须为特定网站编写自己的抓取器吗?
答:先查看 solutions/ 目录——它已经覆盖了 30 多个平台(Amazon、YouTube、Google Maps、Instagram、LinkedIn 等)。对于新目标,可以使用 Skill Forge 通过一次探索会话生成可复用的 Skill。
问:哪些 AI 智能体可以使用它?
答:任何能够执行 shell 命令的智能体,包括 Claude Code、Cursor 以及基于 VS Code 的智能体。
问:在哪里可以找到完整的命令参考?
答:参见仓库中的 docs/ 目录,从 docs/quick-start.md 开始。
11. 快速链接
- 仓库:https://github.com/browser-act/skills
- 文档:https://docs.browseract.com
- 快速上手指南:https://github.com/browser-act/skills/blob/main/docs/quick-start.md
- 解决方案目录:https://github.com/browser-act/skills/tree/main/solutions
- 官方网站:https://browseract.com
12. 总结
BrowserAct Skills 为 AI 智能体提供了一种实用且具有韧性的方式,让它们能够针对真实网站操作真实浏览器——反机器人防御、人工交接和节省 token 的状态都包含在内——而不是把浏览器自动化当作一个已经解决的、配合良好的问题。构建智能体工作流的开发者,以及需要从 Amazon、YouTube 或 Google Maps 等平台获取结构化数据的数据/研究团队,可以从 30 多个预构建 Skills 开始,而无需从头编写抓取器,并使用 Skill Forge 将覆盖范围扩展到新站点。