Start / n8n-Workflow-Vorlagen / Webdatensuche und -zusammenfassung mittels KI und Web Scraping mit automatisierten Workflows

Webdatensuche und -zusammenfassung mittels KI und Web Scraping mit automatisierten Workflows

Search & Summarize Web Data with Perplexity, Gemini AI & Bright Data to Webhooks

Dieser Workflow durchsucht Webdaten über Perplexity mit dem Scraper von Bright Data, extrahiert lesbaren Inhalt mit Google Gemini AI, fasst ihn zusammen und sendet die Ergebnisse zur Integration an einen Webhook.

Manuell15 KnotenKI & MLIngenieurwesenKI

Über diesen Workflow

Suche & Zusammenfassung von Webdaten mit Perplexity, Gemini AI & Bright Data zu Webhooks – Workflow-Analyse

Diese N8n-Workflow-Vorlage automatisiert den Prozess der Websuche nach Informationen mit Perplexity über die Web Scraper API von Bright Data, extrahiert lesbare Inhalte aus HTML-Antworten mit Google Gemini AI und fasst die extrahierten Daten über eine LangChain-gestützte Zusammenfassungskette zusammen. Die endgültige zusammengefasste Ausgabe wird dann über eine Webhook-Benachrichtigung an einen externen Dienst gesendet. Dieser Workflow wurde für KI-gestützte Datenextraktion und -verarbeitung entwickelt und demonstriert fortgeschrittene Integrationen zwischen Web Scraping, Sprachmodellen und bedingter Logik innerhalb der n8n-Automatisierungsplattform.

Was der Workflow tut

Der Workflow initiiert eine Suchanfrage auf Perplexity.ai (über das Datensatz-Trigger-System von Bright Data), wartet, bis der Schnappschuss der Ergebnisse bereit ist, lädt ihn herunter, extrahiert sauberen, menschenlesbaren Text aus der HTML-Antwort mit Google Gemini, fasst den Inhalt mit einem weiteren Gemini-Modell zusammen und sendet schließlich die Zusammenfassung an einen konfigurierbaren Webhook-Endpunkt. Er umfasst Fehlerbehandlung, Abrufmechanismen und strukturierte KI-Verarbeitung, um Robustheit und Genauigkeit bei automatisierten Forschungsaufgaben zu gewährleisten.

Er wandelt unstrukturierte Webinhalte effektiv in prägnante, umsetzbare Zusammenfassungen um – ideal für Wettbewerbsanalysen, Marktforschung oder Wissensaggregationssysteme.


Hauptmerkmale und Fähigkeiten

  • Automatisierte Web-Recherche: Löst Echtzeit-Suchen auf Perplexity über die API von Bright Data aus.
  • KI-gestützte Inhaltsextraktion: Verwendet Google Gemini, um nur den relevanten "lesbaren Inhalt" aus komplexem HTML zu extrahieren.
  • Dokumentenzusammenfassung: Nutzt die Zusammenfassungskette von LangChain mit Gemini Flash-Modellen, um kondensierte Erkenntnisse zu generieren.
  • Abrufmechanismus: Implementiert eine Schleife, die den Jobstatus prüft, bis der Scraper einen abgeschlossenen Schnappschuss zurückgibt.
  • Fehlerbehandlung: Bewertet, ob während des Scrapings Fehler aufgetreten sind, bevor fortgefahren wird.
  • Webhook-Integration: Gibt die Endergebnisse über HTTP POST an jedes externe System aus.
  • Modulare KI-Knotennutzung: Demonstriert die Verwendung von @n8n/nodes-langchain-Knoten für LLM-Chaining, Dokumentenladung und Textaufteilung.
  • Credential-Management: Verwendet sicher gespeicherte Anmeldeinformationen für die Bright Data- und Google Gemini-APIs.

Hauptknoten und ihre Zwecke

Knotenname Typ Zweck
Beim Klicken auf ‘Workflow testen’ Manueller Trigger Startet den Workflow manuell zu Testzwecken.
Perplexity Suchanfrage HTTP Request Sendet eine POST-Anfrage an die API von Bright Data, um eine Suche auf Perplexity.ai mit einem vordefinierten Prompt (tell me about BrightData) auszulösen.
Snapshot-ID festlegen Set Speichert die zurückgegebene snapshot_id aus dem anfänglichen Trigger für die spätere Verwendung beim Abrufen und Herunterladen.
Snapshot-Status prüfen HTTP Request Fragt die Bright Data API ab, um zu prüfen, ob die Schnappschusserstellung abgeschlossen ist, indem der Fortschritt abgefragt wird.
Wenn (Statusprüfung) If Condition Prüft, ob das Feld status in der Antwort gleich "ready" ist; leitet die Ausführung entsprechend weiter.
Warten Wait Pausiert die Ausführung für 30 Sekunden, bevor die Statusprüfung erneut versucht wird, wenn sie noch nicht bereit ist.
Auf Fehler prüfen If Condition Validiert, ob die Anzahl der errors Null ist, bevor mit dem Download fortgefahren wird.
Snapshot herunterladen HTTP Request Ruft das vollständige JSON-Ergebnis des abgeschlossenen Schnappschusses unter Verwendung der snapshot_id ab.
Lesbare Datenextraktor Information Extractor (LangChain) Verwendet Google Gemini, um answer_html zu parsen und nur den "lesbaren Inhalt" als reinen Text zu extrahieren.
Google Gemini Chat Model1 LLM Node Stellt das Sprachmodell-Backend für den Datenextraktor bereit (verwendet gemini-2.0-flash-exp).
Zusammenfassung des Suchergebnisses Summarization Chain (LangChain) Nimmt den bereinigten Text und generiert eine prägnante Zusammenfassung unter Verwendung eines Dokumentenlademusters.
Standard-Datenlader Document Loader (LangChain) Speist verarbeitete Dokumente in die Zusammenfassungskette ein.
Rekursiver Zeichen-Text-Splitter Text Splitter (LangChain) Bereitet lange Texte vor, indem sie in handhabbare Abschnitte aufgeteilt werden (mit 100 Zeichen Überlappung).
Google Gemini Chat Model LLM Node Stellt die LLM-Engine für die Zusammenfassungskette bereit (verwendet das experimentelle Modell gemini-2.0-flash-thinking-exp-01-21).
Webhook-Benachrichtiger HTTP Request Sendet die endgültige output (Zusammenfassung) an eine externe URL (webhook.site-Platzhalter).
Haftnotizen Annotation Bietet Dokumentation und Anleitung innerhalb der Leinwand für Benutzer, die Anmeldeinformationen einrichten oder die Flusslogik verstehen.

Anwendungsfälle und Vorteile

Anwendungsfälle:

  • Marktintelligenz-Erfassung: Automatische Zusammenfassung von Wettbewerbsanalysen, Produktbewertungen oder Branchentrends.
  • Content-Aggregationssysteme: Aufbau interner Wissensdatenbanken durch Abrufen und Kondensieren von Online-Artikeln oder Q&A-Plattformen.
  • Forschungsautomatisierung: Ersetzen manueller Browser- und Notizfunktionen durch KI-gesteuerte Such- und Zusammenfassungspipelines.
  • Lead-Generierung & Vorbereitung von Outreach: Schnelles Sammeln von Hintergrundinformationen über Unternehmen oder Einzelpersonen vor der Kontaktaufnahme.
  • Nachrichtenüberwachung: Verfolgen von Erwähnungen von Marken, Technologien oder Ereignissen über Quellen wie von Perplexity kuratierte Antworten.

Vorteile:

  • Zeiteffizienz: Eliminiert Stunden manuellen Lesens und Zusammenfassens.
  • Genauigkeit: KI stellt sicher, dass nur aussagekräftige Inhalte beibehalten und zusammengefasst werden.
  • Skalierbarkeit: Kann geplant oder in großen Mengen für mehrere Abfragen ausgelöst werden.
  • Integrationsfreundlich: Die über Webhook gelieferte Ausgabe ermöglicht die Verbindung mit Slack, CRM, Datenbanken oder E-Mail-Engines.
  • Fehlerresilienz: Eingebaute Schleifen und Bedingungen verhindern Ausfälle aufgrund von Timing-Problemen oder vorübergehenden Fehlern.

Schritt-für-Schritt-Workflow-Logik

  1. Ausführung auslösen

    • Benutzer klickt auf „Workflow testen“ → aktiviert den manuellen Trigger-Knoten.
  2. Suchanfrage initiieren

    • Eine POST-Anfrage wird an https://api.brightdata.com/datasets/v3/trigger gesendet mit:
      • Ziel-URL: https://www.perplexity.ai
      • Prompt: "tell me about BrightData"
      • Land: "US"
      • Dataset ID und Auth-Header enthalten.
    • Die Antwort enthält eine snapshot_id.
  3. Snapshot-ID speichern

    • Der Knoten Set Snapshot Id speichert die snapshot_id aus der vorherigen Antwort zur Wiederverwendung.
  4. Auf Abschluss warten

    • Check Snapshot Status fragt den Fortschritt unter .../progress/{snapshot_id} ab.
    • Ein If-Knoten prüft, ob status === "ready":
      • Wenn wahr → fortfahren.
      • Wenn falsch → löst Wait (30s) aus → Schleife zurück zur erneuten Statusprüfung.
  5. Fehlerprüfung

    • Sobald der Status bereit ist, prüft ein weiterer If-Knoten, ob errors.toString() === "0".
    • Stellt sicher, dass keine Fehler während des Scrapings aufgetreten sind, bevor fortgefahren wird.
  6. Endergebnisse herunterladen

    • Nach erfolgreicher Validierung wird der Schnappschuss im JSON-Format von .../snapshot/{snapshot_id} heruntergeladen.
  7. Lesbaren Inhalt extrahieren

    • Das Feld answer_html wird an den Readable Data Extractor übergeben.
    • Angetrieben von Google Gemini Flash Exp, isoliert er sauberen, lesbaren Text aus verrauschtem HTML.
  8. Vorbereitung für die Zusammenfassung

    • Der extrahierte Text wird in die Summarization Chain eingespeist.
    • Vor der Zusammenfassung durchläuft er:
      • Recursive Character Text Splitter → teilt große Texte in Abschnitte auf.
      • Default Data Loader → lädt die aufgeteilten Texte als KI-bereite Dokumente.
  9. Zusammenfassung generieren

    • Der Knoten Summarization of search result verwendet das zweite Gemini-Modell (thinking-exp), um eine kohärente, übergeordnete Zusammenfassung zu erstellen.
  10. Ausgabe per Webhook senden

    • Die endgültige Zusammenfassung ($json.output) wird per POST an https://webhook.site/... gesendet.
    • Kann durch jeden gewünschten Endpunkt ersetzt werden (z. B. Slack, Airtable, benutzerdefinierte API).

Dieser Workflow veranschaulicht, wie n8n Low-Code-Automatisierung mit leistungsstarken KI-Funktionen kombiniert, um rohe Webdaten in intelligente Ausgaben zu verwandeln – ideal für Entwickler, Forscher und Business-Analysten, die ihre Informationsverarbeitungs-Workflows skalieren möchten.

So geht’s: JSON herunterladen und in n8n „Aus Datei importieren“ wählen.