1. Projektüberblick
Nanobrowser ist eine Open-Source-Chrome-Browsererweiterung, die Multi-Agenten-KI nutzt, um Aufgaben beim Surfen im Web direkt im eigenen Browser des Nutzers zu automatisieren. Sie bietet eine kostenlose, datenschutzfreundliche Alternative zu kostenpflichtigen KI-Browserautomatisierungsdiensten.
2. Hintergrund & Positionierung
Nanobrowser wurde als Reaktion auf kommerzielle „KI-Browseragent“-Produkte (wie OpenAI Operator) entwickelt, die erhebliche monatliche Abonnementgebühren verlangen und gleichzeitig verlangen, dass Nutzer ihre Browsersitzung und Zugangsdaten an einen entfernten Cloud-Dienst übergeben. Die Kernaufgabe des Projekts besteht darin, autonome Webautomatisierung zugänglich, transparent und kostenlos zu machen, indem es vollständig als lokale Chrome-Erweiterung läuft.
Im Vergleich zu ähnlichen KI-Browseragenten unterscheidet sich Nanobrowser auf drei Arten:
- Multi-Agenten-Design — statt dass ein einzelnes Modell versucht, gleichzeitig zu planen und zu handeln, trennt es das logische Denken („was als Nächstes zu tun ist“) von der Ausführung („wie man klickt/tippt/navigiert“) zwischen spezialisierten Agenten.
- Eigenes Modell mitbringen — Nutzer sind nicht an einen einzigen KI-Anbieter gebunden; sie können Anbieter kombinieren und sogar einem Agenten ein günstigeres Modell und einem anderen ein stärkeres Modell zuweisen, um Kosten und Qualität zu steuern.
- Lokale Priorität beim Datenschutz — das gesamte Surfen, der Authentifizierungsstatus und die Aufgabenausführung bleiben in der eigenen Browsersitzung des Nutzers, statt über einen Cloud-Automatisierungsdienst eines Drittanbieters geleitet zu werden.
3. Funktionskategorien
🤖 Multi-Agenten-Automatisierung — 2 Kernagenten arbeiten zusammen (Planer und Navigator), um Aufgaben zu zerlegen und auszuführen.
- Planer-Agent für logisches Denken, Aufgabenzerlegung und Strategie
- Navigator-Agent für konkrete Browseraktionen (Klicken, Tippen, Scrollen, Navigieren)
- Agenten-Übergabeschleife, die neu plant, wenn ein Schritt fehlschlägt oder sich die Seite ändert
- Aufgabenautomatisierung über beliebige Websites hinweg, nicht nur über einen festen Satz von Integrationen
💬 Interaktives Seitenpanel — eine dauerhafte Browser-Oberfläche zum Steuern und Überwachen der Agenten.
- Echtzeit-Statusaktualisierungen, während die Agenten arbeiten
- Chat-ähnliche Oberfläche zum Erteilen von Aufgaben und Folgeanweisungen
- Gesprächsverlauf, damit frühere Aufgaben und Ergebnisse erneut aufgerufen werden können
- Kontextbezogene Folgefragen, die eine bestehende Browsersitzung fortsetzen
🔌 Flexible LLM-Integration — unterstützt mehr als 7 LLM-Anbieter, sodass Nutzer Modelle pro Agent wählen können.
- OpenAI (z. B. GPT-4o)
- Anthropic Claude (z. B. Claude Sonnet, Claude Haiku)
- Google Gemini
- Groq, Cerebras (Anbieter für schnelle Inferenz)
- Ollama für vollständig lokale, selbst gehostete Modelle mit offenen Gewichten
- Jeder benutzerdefinierte OpenAI-kompatible Endpunkt
🔒 Datenschutz & lokale Ausführung — hält sensible Daten aus Clouds von Drittanbietern fern.
- Kein obligatorisches Abonnement und kein entferntes Automatisierungs-Backend
- Zugangsdaten und Sitzungscookies bleiben im eigenen Browser des Nutzers
- Nutzer wählen, welcher LLM-Anbieter (einschließlich vollständig lokaler Ollama-Modelle) Aufgabendaten erhält
4. Wichtige Highlights
- Multi-Agenten-Planer/Navigator-Architektur — die Trennung von strategischem Denken und taktischer Ausführung führt zu einer zuverlässigeren mehrstufigen Aufgabenerledigung als eine einzelne monolithische Agentenschleife.
- Modellzuweisung pro Agent — ein stärkeres, teureres Modell kann die Planung übernehmen, während ein günstigeres, schnelleres Modell routinemäßige Navigationsschritte erledigt, wodurch Kosten und Leistungsfähigkeit ausbalanciert werden.
- Kostenlose Alternative zu kostenpflichtigen Browseragenten — vermeidet den Preispunkt von etwa 200 $/Monat kommerzieller operatorartiger Produkte, indem es als kostenlose Browsererweiterung läuft.
- Breite LLM-Anbieterunterstützung — funktioniert mit großen gehosteten APIs (OpenAI, Anthropic, Gemini, Groq, Cerebras) sowie vollständig lokalen Modellen über Ollama.
- Chrome-native Seitenpanel-Benutzeroberfläche — Aufgabensteuerung und Verlauf befinden sich im eigenen Seitenpanel des Browsers statt in einer separaten App oder einem Web-Dashboard.
- Offene Verwaltung — unter Apache-2.0 lizenziert, mit aktiver Discord-Community und öffentlichem Beitragsprozess.
5. Anwendungsfälle nach Rolle
- Allgemeine Entwickler: automatisieren wiederkehrende Browserrecherchen oder QA-Aufgaben (z. B. „Extrahiere die wichtigsten Schlagzeilen von einer Tech-Nachrichtenseite“ oder „Finde angesagte Repositories auf GitHub, die zu einem Thema passen“), ohne benutzerdefinierte Scraping-Skripte schreiben zu müssen.
- Projektmanager / nicht-technische Nutzer: delegieren vergleichende Rechercheaufgaben, wie etwa Einkaufsvergleiche über mehrere Websites nach Preis, Funktionen und Spezifikationen, über Chat-Anweisungen in natürlicher Sprache statt manuelles Surfen.
6. Erste Schritte
Finden Sie, was Sie brauchen — durchsuchen Sie die README und die Discord-Community nach Beispielaufforderungen und empfohlenen Modellkonfigurationen:
https://github.com/nanobrowser/nanobrowser
Installieren / integrieren — installieren Sie die Erweiterung aus dem Chrome Web Store oder erstellen Sie sie aus dem Quellcode für die neueste Entwicklungsversion:
git clone https://github.com/nanobrowser/nanobrowser.git
cd nanobrowser
pnpm install
pnpm build
Laden Sie anschließend die dist-Ausgabe als entpackte Erweiterung über chrome://extensions/ mit aktiviertem Entwicklermodus. Erfordert Node.js v22.12.0+ und pnpm v9.15.1+.
Mitwirken — lesen Sie den Beitragsleitfaden und öffnen Sie dann einen Pull-Request oder teilen Sie Aufforderungen/Feedback über Discord:
CONTRIBUTING.md
Sicherheitsprobleme sollten privat über GitHub Security Advisories gemeldet werden und nicht über öffentliche Issues.
7. Projektstruktur
nanobrowser/
├── chrome-extension/ # Erweiterungs-Hülle: Manifest, Hintergrundskript, Build-Konfiguration
│ ├── manifest.js
│ └── src/
├── pages/ # UI-Oberflächen der Erweiterung
│ ├── content/ # In Webseiten injizierte Content-Skripte
│ ├── options/ # Options-/Einstellungsseite der Erweiterung
│ └── side-panel/ # Haupt-Chat-/Seitenpanel-Oberfläche, in der die Agenten laufen
├── packages/ # Gemeinsam genutzte interne Pakete (Monorepo)
│ ├── shared/ # Gemeinsam genutzte Typen/Dienstprogramme in der gesamten Erweiterung
│ ├── storage/ # Lokale Speicher-/Zustandsverwaltung
│ ├── i18n/ # Internationalisierung
│ ├── ui/ # Gemeinsam genutzte UI-Komponenten
│ └── vite-config/ # Gemeinsam genutzte Build-Werkzeuge
├── CONTRIBUTING.md
├── SECURITY.md
└── package.json
chrome-extension/ enthält den Einstiegspunkt der Browsererweiterung und das Manifest; pages/side-panel/ ist der Ort, an dem das Planer/Navigator-Chat-Erlebnis lebt; packages/ enthält die gemeinsam genutzten Bibliotheken, die über die verschiedenen UI-Oberflächen der Erweiterung hinweg wiederverwendet werden.
8. Verwandtes Ökosystem
- Chrome-Erweiterungsplattform — Nanobrowser basiert auf den Manifest-V3-Erweiterungs-APIs von Chrome und der Seitenpanel-API.
- LLM-Anbieter, mit denen es integriert: OpenAI, Anthropic Claude, Google Gemini, Groq, Cerebras und Ollama für lokale Modelle mit offenen Gewichten (z. B. Qwen, Falcon, Mistral).
- pnpm / Turborepo-Werkzeuge — die Codebasis ist als pnpm-Workspace-Monorepo organisiert und mit Turborepo-artiger Aufgabenorchestrierung aufgebaut.
- Ergänzende Kategorie: steht neben anderen KI-Browserautomatisierungs- und Computer-Nutzungs-Agentenprojekten und zeichnet sich durch seinen kostenlosen, erweiterungsbasierten Multi-Agenten-Ansatz aus.
9. Lizenz
Lizenziert unter Apache License 2.0.
- ✅ Kostenlos zu verwenden, zu modifizieren und zu verbreiten, auch für kommerzielle Zwecke
- ✅ Kann geforkt und mit Namensnennung in abgeleitete Browsererweiterungen eingebaut werden
- ❌ Es wird keine Garantie gewährt; das Projekt schließt die Haftung für Missbrauch aus
- ℹ️ Das Projekt lehnt ausdrücklich die Verantwortung für jegliche kryptowährungsbezogenen abgeleiteten Projekte ab, die darauf aufbauen
10. FAQ
F: Muss ich für ein Abonnement bezahlen, um Nanobrowser zu nutzen?
A: Nein. Nanobrowser selbst ist kostenlos und quelloffen; Sie zahlen nur für die Nutzung der LLM-API, die Sie verbinden möchten (oder gar nichts, wenn Sie lokale Modelle über Ollama ausführen).
F: Welche LLM-Anbieter werden unterstützt?
A: OpenAI, Anthropic Claude, Google Gemini, Groq, Cerebras und selbst gehostete Modelle über Ollama sowie jeder benutzerdefinierte OpenAI-kompatible API-Endpunkt.
F: Werden meine Browserdaten an die eigenen Server von Nanobrowser gesendet?
A: Nein. Nanobrowser läuft lokal als Chrome-Erweiterung; die Aufgabenausführung findet in Ihrer eigenen Browsersitzung statt, und Daten werden nur an den von Ihnen konfigurierten LLM-Anbieter gesendet.
F: Wie installiere ich es aus dem Quellcode?
A: Klonen Sie das Repository, installieren Sie die Abhängigkeiten mit pnpm install, führen Sie pnpm build aus und laden Sie dann die Build-Ausgabe als entpackte Erweiterung unter chrome://extensions/.
F: Kann ich unterschiedliche Modelle für die Planung im Vergleich zu Browseraktionen verwenden?
A: Ja. Den Planer- und Navigator-Agenten von Nanobrowser kann jeweils ein anderes LLM-Modell zugewiesen werden, sodass Sie ein stärkeres Modell für das logische Denken mit einem günstigeren/schnelleren Modell für die routinemäßige Navigation kombinieren können.
11. Schnelllinks
- Repository: https://github.com/nanobrowser/nanobrowser
- Beitragsleitfaden: https://github.com/nanobrowser/nanobrowser/blob/master/CONTRIBUTING.md
- Sicherheitsrichtlinie: https://github.com/nanobrowser/nanobrowser/blob/master/SECURITY.md
- Datenschutzrichtlinie: https://github.com/nanobrowser/nanobrowser/blob/master/PRIVACY.md
12. Zusammenfassung
Nanobrowser bringt Multi-Agenten-KI-Automatisierung in den alltäglichen Browsergebrauch, indem es vollständig als kostenlose, quelloffene Chrome-Erweiterung läuft und nicht als kostenpflichtiger Cloud-Dienst. Es eignet sich am besten für Entwickler, Forscher und allgemeine Nutzer, die wiederkehrende Web-Recherchen und Browseraufgaben automatisieren möchten, während sie die Kontrolle darüber behalten, welches KI-Modell ihre Daten verarbeitet und wie viel es kostet.