Über diesen Workflow
Suche & Zusammenfassung von Webdaten mit Perplexity, Gemini AI & Bright Data zu Webhooks – Workflow-Analyse
Diese N8n-Workflow-Vorlage automatisiert den Prozess der Websuche nach Informationen mit Perplexity über die Web Scraper API von Bright Data, extrahiert lesbare Inhalte aus HTML-Antworten mit Google Gemini AI und fasst die extrahierten Daten über eine LangChain-gestützte Zusammenfassungskette zusammen. Die endgültige zusammengefasste Ausgabe wird dann über eine Webhook-Benachrichtigung an einen externen Dienst gesendet. Dieser Workflow wurde für KI-gestützte Datenextraktion und -verarbeitung entwickelt und demonstriert fortgeschrittene Integrationen zwischen Web Scraping, Sprachmodellen und bedingter Logik innerhalb der n8n-Automatisierungsplattform.
Was der Workflow tut
Der Workflow initiiert eine Suchanfrage auf Perplexity.ai (über das Datensatz-Trigger-System von Bright Data), wartet, bis der Schnappschuss der Ergebnisse bereit ist, lädt ihn herunter, extrahiert sauberen, menschenlesbaren Text aus der HTML-Antwort mit Google Gemini, fasst den Inhalt mit einem weiteren Gemini-Modell zusammen und sendet schließlich die Zusammenfassung an einen konfigurierbaren Webhook-Endpunkt. Er umfasst Fehlerbehandlung, Abrufmechanismen und strukturierte KI-Verarbeitung, um Robustheit und Genauigkeit bei automatisierten Forschungsaufgaben zu gewährleisten.
Er wandelt unstrukturierte Webinhalte effektiv in prägnante, umsetzbare Zusammenfassungen um – ideal für Wettbewerbsanalysen, Marktforschung oder Wissensaggregationssysteme.
Hauptmerkmale und Fähigkeiten
- Automatisierte Web-Recherche: Löst Echtzeit-Suchen auf Perplexity über die API von Bright Data aus.
- KI-gestützte Inhaltsextraktion: Verwendet Google Gemini, um nur den relevanten "lesbaren Inhalt" aus komplexem HTML zu extrahieren.
- Dokumentenzusammenfassung: Nutzt die Zusammenfassungskette von LangChain mit Gemini Flash-Modellen, um kondensierte Erkenntnisse zu generieren.
- Abrufmechanismus: Implementiert eine Schleife, die den Jobstatus prüft, bis der Scraper einen abgeschlossenen Schnappschuss zurückgibt.
- Fehlerbehandlung: Bewertet, ob während des Scrapings Fehler aufgetreten sind, bevor fortgefahren wird.
- Webhook-Integration: Gibt die Endergebnisse über HTTP POST an jedes externe System aus.
- Modulare KI-Knotennutzung: Demonstriert die Verwendung von
@n8n/nodes-langchain-Knoten für LLM-Chaining, Dokumentenladung und Textaufteilung. - Credential-Management: Verwendet sicher gespeicherte Anmeldeinformationen für die Bright Data- und Google Gemini-APIs.
Hauptknoten und ihre Zwecke
| Knotenname | Typ | Zweck |
|---|---|---|
| Beim Klicken auf ‘Workflow testen’ | Manueller Trigger | Startet den Workflow manuell zu Testzwecken. |
| Perplexity Suchanfrage | HTTP Request | Sendet eine POST-Anfrage an die API von Bright Data, um eine Suche auf Perplexity.ai mit einem vordefinierten Prompt (tell me about BrightData) auszulösen. |
| Snapshot-ID festlegen | Set | Speichert die zurückgegebene snapshot_id aus dem anfänglichen Trigger für die spätere Verwendung beim Abrufen und Herunterladen. |
| Snapshot-Status prüfen | HTTP Request | Fragt die Bright Data API ab, um zu prüfen, ob die Schnappschusserstellung abgeschlossen ist, indem der Fortschritt abgefragt wird. |
| Wenn (Statusprüfung) | If Condition | Prüft, ob das Feld status in der Antwort gleich "ready" ist; leitet die Ausführung entsprechend weiter. |
| Warten | Wait | Pausiert die Ausführung für 30 Sekunden, bevor die Statusprüfung erneut versucht wird, wenn sie noch nicht bereit ist. |
| Auf Fehler prüfen | If Condition | Validiert, ob die Anzahl der errors Null ist, bevor mit dem Download fortgefahren wird. |
| Snapshot herunterladen | HTTP Request | Ruft das vollständige JSON-Ergebnis des abgeschlossenen Schnappschusses unter Verwendung der snapshot_id ab. |
| Lesbare Datenextraktor | Information Extractor (LangChain) | Verwendet Google Gemini, um answer_html zu parsen und nur den "lesbaren Inhalt" als reinen Text zu extrahieren. |
| Google Gemini Chat Model1 | LLM Node | Stellt das Sprachmodell-Backend für den Datenextraktor bereit (verwendet gemini-2.0-flash-exp). |
| Zusammenfassung des Suchergebnisses | Summarization Chain (LangChain) | Nimmt den bereinigten Text und generiert eine prägnante Zusammenfassung unter Verwendung eines Dokumentenlademusters. |
| Standard-Datenlader | Document Loader (LangChain) | Speist verarbeitete Dokumente in die Zusammenfassungskette ein. |
| Rekursiver Zeichen-Text-Splitter | Text Splitter (LangChain) | Bereitet lange Texte vor, indem sie in handhabbare Abschnitte aufgeteilt werden (mit 100 Zeichen Überlappung). |
| Google Gemini Chat Model | LLM Node | Stellt die LLM-Engine für die Zusammenfassungskette bereit (verwendet das experimentelle Modell gemini-2.0-flash-thinking-exp-01-21). |
| Webhook-Benachrichtiger | HTTP Request | Sendet die endgültige output (Zusammenfassung) an eine externe URL (webhook.site-Platzhalter). |
| Haftnotizen | Annotation | Bietet Dokumentation und Anleitung innerhalb der Leinwand für Benutzer, die Anmeldeinformationen einrichten oder die Flusslogik verstehen. |
Anwendungsfälle und Vorteile
Anwendungsfälle:
- Marktintelligenz-Erfassung: Automatische Zusammenfassung von Wettbewerbsanalysen, Produktbewertungen oder Branchentrends.
- Content-Aggregationssysteme: Aufbau interner Wissensdatenbanken durch Abrufen und Kondensieren von Online-Artikeln oder Q&A-Plattformen.
- Forschungsautomatisierung: Ersetzen manueller Browser- und Notizfunktionen durch KI-gesteuerte Such- und Zusammenfassungspipelines.
- Lead-Generierung & Vorbereitung von Outreach: Schnelles Sammeln von Hintergrundinformationen über Unternehmen oder Einzelpersonen vor der Kontaktaufnahme.
- Nachrichtenüberwachung: Verfolgen von Erwähnungen von Marken, Technologien oder Ereignissen über Quellen wie von Perplexity kuratierte Antworten.
Vorteile:
- Zeiteffizienz: Eliminiert Stunden manuellen Lesens und Zusammenfassens.
- Genauigkeit: KI stellt sicher, dass nur aussagekräftige Inhalte beibehalten und zusammengefasst werden.
- Skalierbarkeit: Kann geplant oder in großen Mengen für mehrere Abfragen ausgelöst werden.
- Integrationsfreundlich: Die über Webhook gelieferte Ausgabe ermöglicht die Verbindung mit Slack, CRM, Datenbanken oder E-Mail-Engines.
- Fehlerresilienz: Eingebaute Schleifen und Bedingungen verhindern Ausfälle aufgrund von Timing-Problemen oder vorübergehenden Fehlern.
Schritt-für-Schritt-Workflow-Logik
-
Ausführung auslösen
- Benutzer klickt auf „Workflow testen“ → aktiviert den manuellen Trigger-Knoten.
-
Suchanfrage initiieren
- Eine POST-Anfrage wird an
https://api.brightdata.com/datasets/v3/triggergesendet mit:- Ziel-URL:
https://www.perplexity.ai - Prompt:
"tell me about BrightData" - Land:
"US" - Dataset ID und Auth-Header enthalten.
- Ziel-URL:
- Die Antwort enthält eine
snapshot_id.
- Eine POST-Anfrage wird an
-
Snapshot-ID speichern
- Der Knoten
Set Snapshot Idspeichert diesnapshot_idaus der vorherigen Antwort zur Wiederverwendung.
- Der Knoten
-
Auf Abschluss warten
Check Snapshot Statusfragt den Fortschritt unter.../progress/{snapshot_id}ab.- Ein If-Knoten prüft, ob
status === "ready":- Wenn wahr → fortfahren.
- Wenn falsch → löst Wait (30s) aus → Schleife zurück zur erneuten Statusprüfung.
-
Fehlerprüfung
- Sobald der Status bereit ist, prüft ein weiterer If-Knoten, ob
errors.toString() === "0". - Stellt sicher, dass keine Fehler während des Scrapings aufgetreten sind, bevor fortgefahren wird.
- Sobald der Status bereit ist, prüft ein weiterer If-Knoten, ob
-
Endergebnisse herunterladen
- Nach erfolgreicher Validierung wird der Schnappschuss im JSON-Format von
.../snapshot/{snapshot_id}heruntergeladen.
- Nach erfolgreicher Validierung wird der Schnappschuss im JSON-Format von
-
Lesbaren Inhalt extrahieren
- Das Feld
answer_htmlwird an den Readable Data Extractor übergeben. - Angetrieben von Google Gemini Flash Exp, isoliert er sauberen, lesbaren Text aus verrauschtem HTML.
- Das Feld
-
Vorbereitung für die Zusammenfassung
- Der extrahierte Text wird in die Summarization Chain eingespeist.
- Vor der Zusammenfassung durchläuft er:
- Recursive Character Text Splitter → teilt große Texte in Abschnitte auf.
- Default Data Loader → lädt die aufgeteilten Texte als KI-bereite Dokumente.
-
Zusammenfassung generieren
- Der Knoten Summarization of search result verwendet das zweite Gemini-Modell (
thinking-exp), um eine kohärente, übergeordnete Zusammenfassung zu erstellen.
- Der Knoten Summarization of search result verwendet das zweite Gemini-Modell (
-
Ausgabe per Webhook senden
- Die endgültige Zusammenfassung (
$json.output) wird per POST anhttps://webhook.site/...gesendet. - Kann durch jeden gewünschten Endpunkt ersetzt werden (z. B. Slack, Airtable, benutzerdefinierte API).
- Die endgültige Zusammenfassung (
Dieser Workflow veranschaulicht, wie n8n Low-Code-Automatisierung mit leistungsstarken KI-Funktionen kombiniert, um rohe Webdaten in intelligente Ausgaben zu verwandeln – ideal für Entwickler, Forscher und Business-Analysten, die ihre Informationsverarbeitungs-Workflows skalieren möchten.
So geht’s: JSON herunterladen und in n8n „Aus Datei importieren“ wählen.