Scraping ausführen
Nachdem Sie Ihre Scraping-Einstellungen konfiguriert haben, müssen Sie einen Scraping-Lauf starten, um eine neue Inhaltskollektion zu erstellen. Jeder Lauf erzeugt eine völlig neue Kollektion — bestehende Kollektionen werden nicht verändert. Diese Anleitung erklärt, wie Sie einen Lauf starten, seinen Fortschritt in jeder Phase überwachen und auftretende Fehler behandeln.

Scraping starten
Um das Scraping zu starten, navigieren Sie zu Ihrem Projekt im Verwaltungsportal und öffnen Sie den Bereich Knowledge base -> Collections. Klicken Sie auf die Schaltfläche, um einen neuen Scraping-Lauf zu starten. Das System beginnt mit dem Crawlen der konfigurierten URLs, extrahiert Inhalte und generiert die für die KI-Suche benötigten Embeddings.
Jeder Scraping-Lauf verarbeitet den gesamten konfigurierten Umfang und erstellt eine neue Kollektion mit dem aktuellen Stand Ihrer Website-Inhalte. Wenn Sie seit dem letzten Lauf Änderungen vorgenommen haben, starten Sie einen neuen Scraping-Lauf und aktivieren Sie anschließend die entstandene Kollektion, um die vorherige zu ersetzen. Sie können das Scraping so oft wie nötig ausführen, um Ihre Inhalte aktuell zu halten.
Scraping kann manuell im Portal oder automatisch über die Einstellungen Scheduled Refresh im Bereich Scraping gestartet werden. Automatische Läufe verwenden dieselbe Pipeline und erzeugen ebenfalls bei jeder Ausführung eine neue Kollektion.
Kollektionen
Jeder Scraping-Lauf erzeugt eine Kollektion — eine Momentaufnahme aller gescrapten Inhalte. Es können mehrere Kollektionen gleichzeitig vorhanden sein. Diejenige, die aktuell die Website-Besucher bedient, ist als aktive Kollektion gekennzeichnet.
Activate — klicken Sie auf die Schaltfläche Activate in der Spalte Active, um die aktive Kollektion zu wechseln. Nur Kollektionen, deren Scraping-Lauf abgeschlossen ist, können aktiviert werden.
Open — die Spalte Open bietet zwei Schaltflächen:
- Browse (Listensymbol) — öffnet die Detailseite der Kollektion mit allen gescrapten Seiten. Weitere Informationen unter Inhalte durchsuchen.
- Search (Suchsymbol) — öffnet die semantische Suche über den Inhalt der Kollektion. Weitere Informationen unter Suche testen.
Actions — die Spalte Actions bietet zusätzliche Operationen:
- Cancel — stoppt einen Scraping-Lauf, der noch läuft.
- Delete — entfernt die Kollektion. Diese Aktion ist für die aktive Kollektion und für Kollektionen, deren Scraping noch läuft, deaktiviert.
Pipeline-Status überwachen
Sobald ein Scraping-Lauf gestartet ist, können Sie seinen Fortschritt in Echtzeit im Portal verfolgen. Die Pipeline zeigt die aktuelle Verarbeitungsstufe zusammen mit Statistiken wie der Anzahl entdeckter Seiten, verarbeiteter Seiten und aufgetretener Fehler an. Die Fortschrittsansicht kann durch Klicken auf die Aktualisierungsschaltfläche über der Tabelle neben der Schaltfläche Run scraping aktualisiert werden.
Scraping-Stufen verstehen
Die Scraping-Pipeline besteht aus mehreren Stufen, die nacheinander ausgeführt werden:
-
Crawling — Der Scraper besucht Ihre konfigurierten URLs und folgt Links, um Seiten innerhalb Ihrer Website zu entdecken. In dieser Phase erstellt er eine Übersicht aller zu verarbeitenden Seiten und lädt deren HTML-Inhalt herunter.
-
Extracting — Für jede entdeckte Seite wendet der Scraper Ihre CSS-Selektor-Konfiguration an, um den relevanten Textinhalt zu extrahieren. Er entfernt HTML-Tags, überspringt ausgeschlossene Elemente und erzeugt sauberen Klartext, der den bedeutungsvollen Inhalt jeder Seite darstellt.
-
Embedding — Der extrahierte Text wird in Abschnitte unterteilt und durch ein Embedding-Modell verarbeitet, um Vektordarstellungen zu generieren. Diese Embeddings ermöglichen die semantische Suche, sodass die KI Inhalte anhand der Bedeutung finden kann und nicht nur durch Schlüsselwortabgleich.
Nach erfolgreichem Abschluss aller Stufen ist die neue Kollektion bereit zur Aktivierung. Sobald Sie sie aktivieren, erhalten Besucher, die das Widget nutzen, Ergebnisse aus den neuen Inhalten.
Fehlerbehandlung
Während eines Scraping-Laufs können einige Seiten aufgrund von Netzwerkfehlern, Zeitüberschreitungen, Serverfehlern oder unerwarteten Seitenstrukturen nicht verarbeitet werden. Die Pipeline meldet diese Fehler und fährt mit der Verarbeitung der übrigen Seiten fort. Nach Abschluss des Laufs können Sie die Fehlerliste überprüfen, um problematische Seiten zu identifizieren.
Häufige Fehler sind Seiten, die HTTP-Statuscodes 404 oder 500 zurückgeben, Seiten, die zu lange zum Laden brauchen, oder Seiten mit ungewöhnlichen HTML-Strukturen, die der Inhaltsextraktor nicht verarbeiten kann. Bei wiederkehrenden Fehlern prüfen Sie, ob die betroffenen Seiten in einem normalen Browser erreichbar sind, und passen Sie bei Bedarf Ihre Scraping-Konfiguration an. Seiten, die nicht verarbeitet werden konnten, werden aus der Wissensbasis ausgeschlossen, verhindern aber nicht den erfolgreichen Abschluss des restlichen Laufs.