Start / Open Source / skills

skills

Open-Source-CLI, mit der KI-Agenten echte Browser steuern, Anti-Bot-Abwehr umgehen und bei Blockaden an Menschen übergeben können.

PythonMITCrawler
⭐ GitHubhttps://github.com/browser-act/skills
5,500
Stars
+0
Star-Wachstum
24. Aug. 2026
Zuletzt aktualisiert
2
Klicks

1. Projektüberblick

BrowserAct Skills ist eine Open-Source-CLI für Browserautomatisierung, mit der KI-Agenten (Claude Code, Cursor, VS Code und andere shellfähige Agenten) einen echten Browser steuern können, um Webaufgaben zu erledigen – auch auf Websites, die durch Anti-Bot-Systeme geschützt sind – und an einen menschlichen Bediener übergeben können, wenn der Agent nicht weiterkommt.

2. Hintergrund & Positionierung

Die meisten Frameworks für Browserautomatisierung gehen von einem sauberen, kooperativen Web aus: keine CAPTCHAs, kein Fingerprinting, keine Login-Wände. In der Praxis stoßen KI-Agenten, die auf realen Websites browsen, suchen oder Daten extrahieren wollen, ständig auf Anti-Bot-Abwehr, Geobeschränkungen und kontogeschützte Inhalte, die naive Automatisierung scheitern lassen. BrowserAct wurde entwickelt, um diese Lücke zu schließen – es behandelt „der Agent wird irgendwann blockiert" als Normalfall, nicht als Ausnahme, und ist entsprechend konzipiert.

Seine Kernaufgabe ist es, Agenten eine robuste, token-effiziente Schnittstelle zum Live-Web zu bieten, mit einer eingebauten Notlösung: Wenn die Automatisierung wirklich nicht weiterkommt, kann die Steuerung über eine Live-Fernsteuerungs-URL an einen Menschen übergeben werden, und der Agent setzt die Arbeit automatisch fort, sobald der Mensch fertig ist.

Im Vergleich zu allgemeinen Bibliotheken für Browserautomatisierung (z. B. Playwright-/Puppeteer-Wrapper) unterscheidet sich BrowserAct in dreierlei Hinsicht:

  • Es bietet eine dreischichtige Anti-Bot-Strategie (Umgebung, Ausführung, Mensch), statt die Umgehung vollständig dem Aufrufer zu überlassen.
  • Es liefert einen indexierten, textbasierten Seitenzustand statt rohem DOM/HTML/JSON, was deutlich günstiger bei LLM-Tokens ist und für Agenten leichter zu interpretieren.
  • Es bündelt einen Katalog mit über 30 fertigen Skills für beliebte Plattformen (Amazon, YouTube, Google Maps, Instagram usw.), sodass gängige Scraping-Aufgaben keine Automatisierung von Grund auf erfordern.

3. Funktionskategorien

🛡️ Anti-Bot-Schutz (3-Schichten-Ansatz) – Mechanismen, um die Automatisierung gegen geschützte Websites am Laufen zu halten.

  • Stealth-Browser-Fingerprinting zur Vermeidung von Bot-Erkennungssignaturen
  • TLS-Fingerprint-Rotation
  • Proxy-Rotation für IP-Vielfalt
  • Automatisches CAPTCHA-Lösen
  • Live-URL für menschliche Übernahme, wenn die Automatisierung vollständig blockiert ist

Zweck: lang laufende oder sensible Aufgaben am Leben erhalten, auch wenn eine Website automatisierten Zugriff aktiv abwehrt.

🌐 Browser-Modi – unterschiedliche Sitzungsidentitäten je nach Aufgabe.

  • Chrome-Modus (verwendet den vorhandenen Anmeldestatus des lokalen Browsers)
  • Stealth-Datenschutzmodus (frischer, nicht verknüpfbarer Fingerabdruck pro Sitzung)
  • Stealth-Modus mit fester Identität (persistenter Fingerabdruck/Konto über Sitzungen hinweg)

Zweck: die Automatisierungsidentität an die Aufgabe anpassen – angemeldete Arbeitsabläufe, anonymes Scraping oder konsistente Langzeitkonten.

🤖 Agentenoptimierte Interaktion – die zentralen CLI-Grundelemente, die Agenten direkt aufrufen.

  • Indexierte Interaktion (click 3, input 5 "text") statt roher Selektoren
  • Kompakte, token-effiziente Textausgabe des Seitenzustands
  • Mehrsitzungs- und Mehrbrowser-Parallelbetrieb ohne gegenseitige Störung der Aufgaben

Zweck: Browsersteuerung für LLM-gesteuerte Agenten günstig und zuverlässig machen, nicht nur für menschliche Skripte.

📦 Lösungskatalog (über 30 vorgefertigte Skills) – einsatzbereite Automatisierung für häufige Ziele.

  • Amazon, eBay, Etsy, Walmart (Produkt-/Angebots-/Bewertungsextraktion)
  • YouTube, TikTok, Instagram, X/Twitter (Inhalte, Kommentare, Profildaten)
  • Google Maps, LinkedIn, Indeed (Leads, Unternehmensinformationen, Stellenanzeigen)
  • Reddit, Xiaohongshu, Douyin, Zhihu, WeChat (Abdeckung regionaler Plattformen)

Zweck: das Neuimplementieren von Scrapern für Plattformen überspringen, die die Community bereits abdeckt.

🛠️ Skill Forge – ein Begleitwerkzeug, das neue Skills erzeugt.

  • Erkundet eine Zielwebsite einmal und erzeugt daraus einen wiederverwendbaren, einsetzbaren Scraping-Skill

Zweck: einmalige manuelle Erkundung in ein wiederholbares, teilbares Automatisierungs-Asset verwandeln.

4. Wichtige Highlights

  • Menschliche Übergabe ohne Zustandsverlust – wenn ein Agent an eine Wand stößt (CAPTCHA, 2FA, manuelle Verifizierung), kann er einen Live-Fernsteuerungslink erzeugen; ein Mensch übernimmt von einem beliebigen Gerät aus, und der Agent setzt die Sitzung danach fort, statt neu zu starten.
  • Token-effizienter Seitenzustand – Seiten werden als indexierte, textformatierte Liste interaktiver Elemente dargestellt statt als rohes HTML/DOM, was die LLM-Kontextkosten im Vergleich zu typischer Automatisierungsausgabe erheblich senkt.
  • Dreischichtige Anti-Bot-Abwehr – Stealth-Fingerabdrücke, TLS-/Proxy-Rotation und CAPTCHA-Lösen sind in die CLI integriert, statt dem Integrator zum Selbstzusammenbau überlassen zu werden.
  • Parallele, isolierte Sitzungen – mehrere gleichzeitige Browsersitzungen und Konten laufen unabhängig voneinander, nützlich für Multi-Konto-Arbeitsabläufe oder parallele Datenerfassung.
  • Cloud- oder lokale Ausführung – Aufgaben können ohne Einrichtung auf der verwalteten Cloud-Infrastruktur von BrowserAct laufen oder als lokale Skills direkt in den Werkzeugsatz eines Agenten integriert werden.
  • Größtenteils kostenlos nutzbar – die meisten Befehle erfordern keine Anmeldung oder nur einen kostenlosen Login; nur verwaltete Proxys und Stealth-Browser-Sitzungen über ein kostenloses Kontingent hinaus sind kostenpflichtig.

5. Anwendungsfälle nach Rolle

Allgemeine Entwickler – erstellen Agenten-Workflows oder Skripte, die auf echten Websites browsen, sich durchklicken und Daten extrahieren müssen, ohne für jedes Anti-Bot-Hindernis Selektoren von Hand zu schreiben.

Daten- / Forschungswissenschaftler – sammeln strukturierte Daten (Produktangebote, Social-Media-Beiträge, Bewertungen, Unternehmensinformationen) von Plattformen wie Amazon, Google Maps oder Instagram für Analysen und nutzen dafür den vorgefertigten Lösungskatalog statt eigener Scraper.

Projektmanager / Wachstums- und Marketingteams – extrahieren Wettbewerbsinformationen, Lead-Listen oder Inhaltstrends (LinkedIn-Jobs, Product-Hunt-Starts, Reddit-Diskussionen), ohne eine Scraping-Pipeline von Grund auf entwickeln zu müssen.

6. Erste Schritte

Finden, was du brauchst – durchsuche den Lösungskatalog nach einem vorhandenen Skill für deine Zielplattform oder sieh in der Dokumentation nach der vollständigen Befehlsreferenz:

# siehe docs/quick-start.md und das Verzeichnis solutions/ im Repository

Installieren / Integrieren – weise deinen KI-Agenten an, den Skill direkt aus dem Repository zu installieren:

Install browser-act.
Skill source: https://github.com/browser-act/skills/tree/main/browser-act
Verify it works after installation.

Führe dann einen ersten Befehl aus:

browser-act stealth-extract https://example.com

Mitwirken – fork das Repository, füge einen Skill unter solutions/ hinzu oder verbessere ihn und öffne einen Pull-Request; neue Plattformintegrationen und Korrekturen an bestehenden Skills sind willkommen.

7. Projektstruktur

skills/
├── browser-act/               # Kernimplementierung der CLI
├── browser-act-skill-forge/    # Werkzeug zum Erzeugen neuer Scraping-Skills
├── solutions/                  # Katalog mit über 30 vorgefertigten Plattform-Skills
├── docs/                       # Vollständige Dokumentation (Schnellstart, Befehlsreferenz usw.)
├── assets/readme/               # README-Medienressourcen
├── .github/workflows/           # CI-Konfiguration
├── requirements.txt
└── LICENSE                      # MIT
  • browser-act/ enthält die CLI, die Agenten tatsächlich aufrufen (browser-act <command>).
  • browser-act-skill-forge/ ist das Werkzeug zum Erstellen neuer Skills für Websites, die noch nicht im Katalog enthalten sind.
  • solutions/ ist der Ort, an dem fertige, plattformspezifische Skills liegen – der schnellste Weg zu einer funktionierenden Integration.

8. Verwandtes Ökosystem

  • Upstream-/verwaltete Plattform: api.browseract.com – der verwaltete Cloud-Dienst, der die von der CLI referenzierte gehostete Browserausführung, Proxys und Stealth-Sitzungen bereitstellt.
  • Agenten-Hosts, mit denen es integriert: Claude Code, Cursor, VS Code und andere KI-Agenten mit Shell-Ausführungsfähigkeit.
  • Ergänzende Werkzeuge: allgemeine Bibliotheken für Browserautomatisierung (z. B. Playwright, Puppeteer) behandeln ähnliche Low-Level-Browsersteuerung, jedoch ohne BrowserActs Anti-Bot-Schicht, agentenorientierten indexierten Zustand oder vorgefertigten Skill-Katalog.

9. Lizenz

MIT-Lizenz.

  • ✅ Frei zu nutzen, zu kopieren, zu verändern, zusammenzuführen, zu veröffentlichen und zu verbreiten, auch in kommerziellen und proprietären Projekten.
  • ✅ Unterlizenzierung und private Änderung sind erlaubt.
  • ❌ Es wird keine Gewährleistung übernommen; die Autoren haften nicht für Schäden, die aus der Nutzung entstehen.
  • ℹ️ Der ursprüngliche Urheberrechts- und Lizenzhinweis muss in Kopien oder wesentlichen Teilen der Software erhalten bleiben.
  • ℹ️ Die MIT-Lizenz deckt die CLI und die Skills in diesem Repository ab; der verwaltete Cloud-Dienst von BrowserAct (Proxys, Stealth-Browser über das kostenlose Kontingent hinaus) ist ein separates kostenpflichtiges Angebot und nicht von der Open-Source-Lizenz abgedeckt.

10. FAQ

F: Muss ich mich anmelden, um BrowserAct zu nutzen?
A: Die meisten Kernfunktionen funktionieren ohne Anmeldung oder nur mit einem kostenlosen Login. Kostenpflichtige Nutzung beschränkt sich auf verwaltete Proxys und Stealth-Browser-Sitzungen über das enthaltene kostenlose Kontingent hinaus.

F: Was passiert, wenn eine Website den Agenten vollständig blockiert?
A: Die CLI kann eine Live-Fernsteuerungs-URL erzeugen, sodass ein Mensch die Sitzung von einem beliebigen Gerät aus übernehmen kann; sobald der Mensch fertig ist, setzt der Agent die Arbeit automatisch fort.

F: Muss ich für eine bestimmte Website meinen eigenen Scraper schreiben?
A: Sieh zuerst im Verzeichnis solutions/ nach – es deckt bereits über 30 Plattformen ab (Amazon, YouTube, Google Maps, Instagram, LinkedIn und mehr). Für ein neues Ziel nutze Skill Forge, um aus einer einzigen Erkundungssitzung einen wiederverwendbaren Skill zu erzeugen.

F: Welche KI-Agenten können das nutzen?
A: Jeder Agent, der Shell-Befehle ausführen kann, einschließlich Claude Code, Cursor und VS-Code-basierte Agenten.

F: Wo finde ich die vollständige Befehlsreferenz?
A: Siehe das Verzeichnis docs/ im Repository, beginnend mit docs/quick-start.md.

11. Schnelllinks

12. Zusammenfassung

BrowserAct Skills gibt KI-Agenten eine praktische, robuste Möglichkeit, echte Browser gegen echte Websites einzusetzen – inklusive Anti-Bot-Abwehr, menschlicher Übergabe und token-effizientem Zustand – statt Browserautomatisierung als gelöstes, kooperatives Problem zu behandeln. Entwickler, die Agenten-Workflows erstellen, und Daten-/Forschungsteams, die strukturierte Daten von Plattformen wie Amazon, YouTube oder Google Maps benötigen, können mit den über 30 vorgefertigten Skills beginnen, statt Scraper von Grund auf zu schreiben, und mit Skill Forge die Abdeckung auf neue Websites ausweiten.