首页 / 开源榜单 / skills

skills

开源 CLI,可让 AI 智能体控制真实浏览器、绕过反机器人防御,并在卡住时转交人类处理。

PythonMITCrawler
⭐ GitHubhttps://github.com/browser-act/skills
5,500
Star 数
+0
Star 增速
2026年8月24日
最后更新
2
点击数

1. 项目概述

BrowserAct Skills 是一个开源浏览器自动化 CLI,可让 AI 智能体(Claude Code、Cursor、VS Code 及其他具备 shell 能力的智能体)驱动真实浏览器完成网页任务——包括受反机器人系统保护的站点——并在智能体卡住时将控制权转交给人类操作员。

2. 背景与定位

大多数浏览器自动化框架都假设面对的是一个干净、配合的网络环境:没有验证码、没有指纹识别、没有登录墙。但在实践中,尝试浏览、搜索或从真实网站提取数据的 AI 智能体,会不断遭遇反机器人防御、地理限制和账号门槛,这些都会让简单的自动化方案失效。BrowserAct 正是为了弥合这一差距而构建的——它将“智能体最终会被拦截”视为默认情况而非例外,并围绕这一点进行设计。

其核心使命是为智能体提供一个对活跃网络具有韧性且节省 token 的接口,并内置一个逃生通道:当自动化确实无法继续时,可以通过一个实时远程控制链接将控制权交给人类,人类完成后智能体会自动恢复运行。

与通用浏览器自动化库(如 Playwright/Puppeteer 的封装)相比,BrowserAct 在三个方面有所不同:

  • 它提供了一套三层反机器人策略(环境、执行、人工),而不是把规避工作完全留给调用方。
  • 它返回的是带索引的、基于文本的页面状态,而非原始 DOM/HTML/JSON,这在 LLM token 消耗上要便宜得多,也更便于智能体进行推理。
  • 它捆绑了30 多个现成 Skills 的目录,覆盖热门平台(Amazon、YouTube、Google Maps、Instagram 等),因此常见的抓取任务无需从头编写自动化代码。

3. 功能分类

🛡️ 反机器人防护(三层方案)——让自动化在面对有防御的站点时仍能持续运行的机制。

  • 隐身浏览器指纹识别,避免被机器人检测特征标记
  • TLS 指纹轮换
  • 代理轮换以实现 IP 多样性
  • 自动验证码识别
  • 当自动化被完全拦截时,提供实时人工接管链接

目的:即使站点主动抵抗自动化访问,也能让长时间运行或敏感任务保持存活。

🌐 浏览器模式——根据任务需要提供不同的会话身份。

  • Chrome 模式(复用本地浏览器已有的登录状态)
  • 隐身隐私模式(每个会话使用全新、不可关联的指纹)
  • 隐身固定身份模式(跨会话保持持久指纹/账号)

目的:让自动化身份与任务相匹配——登录工作流、匿名抓取或长期一致的账号。

🤖 面向智能体优化的交互——智能体直接调用的核心 CLI 原语。

  • 带索引的交互(click 3input 5 "text"),而非原始选择器
  • 紧凑、节省 token 的文本状态输出
  • 多会话、多浏览器并发,且无跨任务干扰

目的:让浏览器控制对 LLM 驱动的智能体来说既便宜又可靠,而不仅仅是供人类脚本使用。

📦 解决方案目录(30 多个预构建 Skills)——针对常见目标平台的即用型自动化。

  • Amazon、eBay、Etsy、Walmart(商品/列表/评论提取)
  • YouTube、TikTok、Instagram、X/Twitter(内容、评论、个人资料数据)
  • Google Maps、LinkedIn、Indeed(销售线索、商家信息、职位列表)
  • Reddit、小红书、抖音、知乎、微信(区域平台覆盖)

目的:对于社区已经覆盖的平台,无需重新实现抓取器。

🛠️ Skill Forge——一个用于生成新 Skills 的配套工具。

  • 对目标站点进行一次探索,然后生成一个可复用、可部署的抓取 Skill

目的:将一次性的手动探索转化为可重复、可共享的自动化资产。

4. 核心亮点

  • 不丢失状态的人工交接——当智能体遇到障碍(验证码、双重认证、人工验证)时,它可以生成一个实时远程控制链接;人类可以从任何设备接管,之后智能体会恢复该会话,而不是重新开始。
  • 节省 token 的页面状态——页面以带索引的、文本格式的可交互元素列表呈现,而非原始 HTML/DOM,与典型自动化输出相比,显著降低了 LLM 上下文成本。
  • 三层反机器人防御——隐身指纹、TLS/代理轮换和验证码识别内置于 CLI 中,而不是留给集成方自行拼装。
  • 并行且隔离的会话——多个并发浏览器会话和账号独立运行,适用于多账号工作流或并行数据采集。
  • 云端或本地执行——任务可以在 BrowserAct 的托管云基础设施上运行,无需任何设置;也可以作为本地 Skills 直接集成到智能体的工具集中。
  • 大部分功能免费使用——大多数命令无需注册或仅需免费登录;只有超出免费额度的托管代理和隐身浏览器会话需要付费。

5. 按角色的使用场景

普通开发者——构建需要浏览、点击并从真实网站提取数据的智能体工作流或脚本,而无需为每一个反机器人障碍手写选择器。

数据/研究科学家——使用预构建的解决方案目录(而非自定义抓取器),从 Amazon、Google Maps 或 Instagram 等平台采集结构化数据(商品列表、社交帖子、评论、商家信息)用于分析。

项目经理/增长与营销团队——提取竞争情报、销售线索列表或内容趋势(LinkedIn 职位、Product Hunt 发布、Reddit 讨论),而无需从零搭建抓取流水线。

6. 快速上手

找到你需要的——浏览解决方案目录,寻找覆盖你目标平台的现有 Skill,或查看文档获取完整命令参考:

# 参见 docs/quick-start.md 以及仓库中的 solutions/ 目录

安装/集成——告诉你的 AI 智能体直接从仓库安装该 Skill:

安装 browser-act。
Skill 来源:https://github.com/browser-act/skills/tree/main/browser-act
安装后验证其是否正常工作。

然后运行第一条命令:

browser-act stealth-extract https://example.com

参与贡献——fork 该仓库,在 solutions/ 下添加或改进某个 Skill,然后提交 pull request;欢迎新的平台集成以及对现有 Skills 的修复。

7. 项目结构

skills/
├── browser-act/               # 核心 CLI 实现
├── browser-act-skill-forge/    # 用于生成新抓取 Skills 的工具
├── solutions/                  # 30 多个预构建平台 Skills 的目录
├── docs/                       # 完整文档(快速上手、命令参考等)
├── assets/readme/               # README 媒体资源
├── .github/workflows/           # CI 配置
├── requirements.txt
└── LICENSE                      # MIT
  • browser-act/ 包含智能体实际调用的 CLI(browser-act <command>)。
  • browser-act-skill-forge/ 是用于为目录中尚未覆盖的站点编写新 Skills 的工具。
  • solutions/ 存放现成的、针对特定平台的 Skills——这是实现可用集成的最快路径。

8. 相关生态

  • 上游/托管平台api.browseract.com——托管云服务,为 CLI 所引用的托管浏览器执行、代理和隐身会话提供支持。
  • 可集成的智能体宿主:Claude Code、Cursor、VS Code 以及其他具备 shell 执行能力的 AI 智能体。
  • 互补工具:通用浏览器自动化库(如 Playwright、Puppeteer)解决类似的底层浏览器控制问题,但不具备 BrowserAct 的反机器人层、面向智能体的索引状态或预构建 Skills 目录。

9. 许可证

MIT 许可证。

  • ✅ 可自由使用、复制、修改、合并、发布和分发,包括用于商业和闭源项目。
  • ✅ 允许再许可和私有修改。
  • ❌ 不提供任何担保;作者对因使用而产生的损害不承担责任。
  • ℹ️ 在副本或软件的实质性部分中必须保留原始版权和许可证声明。
  • ℹ️ MIT 许可证涵盖本仓库中的 CLI 和 Skills;BrowserAct 的托管云服务(超出免费额度的代理、隐身浏览器)是单独的付费产品,不在开源许可证覆盖范围内。

10. 常见问题

问:使用 BrowserAct 需要注册吗?
答:大多数核心功能无需注册或仅需免费登录即可使用。付费使用仅限于超出免费额度的托管代理和隐身浏览器会话。

问:当站点完全拦截智能体时会发生什么?
答:CLI 可以生成一个实时远程控制链接,让人类可以从任何设备接管会话;人类完成后,智能体会自动恢复运行。

问:我必须为特定网站编写自己的抓取器吗?
答:先查看 solutions/ 目录——它已经覆盖了 30 多个平台(Amazon、YouTube、Google Maps、Instagram、LinkedIn 等)。对于新目标,可以使用 Skill Forge 通过一次探索会话生成可复用的 Skill。

问:哪些 AI 智能体可以使用它?
答:任何能够执行 shell 命令的智能体,包括 Claude Code、Cursor 以及基于 VS Code 的智能体。

问:在哪里可以找到完整的命令参考?
答:参见仓库中的 docs/ 目录,从 docs/quick-start.md 开始。

11. 快速链接

12. 总结

BrowserAct Skills 为 AI 智能体提供了一种实用且具有韧性的方式,让它们能够针对真实网站操作真实浏览器——反机器人防御、人工交接和节省 token 的状态都包含在内——而不是把浏览器自动化当作一个已经解决的、配合良好的问题。构建智能体工作流的开发者,以及需要从 Amazon、YouTube 或 Google Maps 等平台获取结构化数据的数据/研究团队,可以从 30 多个预构建 Skills 开始,而无需从头编写抓取器,并使用 Skill Forge 将覆盖范围扩展到新站点。