Uruchom skrapowanie
Po skonfigurowaniu ustawień skrapowania musisz uruchomić proces, aby utworzyć nową kolekcję treści. Każde uruchomienie tworzy zupełnie nową kolekcję — nie modyfikuje żadnej istniejącej. Ten przewodnik wyjaśnia, jak rozpocząć skrapowanie, monitorować jego postęp na każdym etapie i obsługiwać ewentualne błędy.

Uruchamianie skrapowania
Aby rozpocząć skrapowanie, przejdź do swojego projektu w portalu zarządzania i otwórz sekcję Knowledge base -> Collections. Kliknij przycisk, aby uruchomić nowe skrapowanie. System rozpocznie pobieranie skonfigurowanych adresów URL, wyodrębnianie treści i generowanie embeddingów potrzebnych do wyszukiwania AI.
Każde uruchomienie skrapowania przetwarza cały skonfigurowany zakres i tworzy nową kolekcję zawierającą aktualny stan treści witryny. Jeśli od ostatniego uruchomienia dokonałeś zmian na stronie, uruchom nowe skrapowanie, a następnie aktywuj powstałą kolekcję, aby zastąpić poprzednią. Możesz uruchamiać skrapowanie tak często, jak potrzebujesz, aby utrzymać treści w aktualnym stanie.
Skrapowanie można uruchamiać ręcznie z poziomu portalu albo automatycznie przez ustawienia Zaplanowane odświeżanie w sekcji Skanowanie. Automatyczne uruchomienia przechodzą przez ten sam pipeline i również tworzą nową kolekcję dla każdego wykonania.
Kolekcje
Każde uruchomienie skrapowania tworzy kolekcję — zapis całej pobranej treści. Jednocześnie może istnieć wiele kolekcji. Ta, która aktualnie obsługuje odwiedzających stronę, jest oznaczona jako aktywna kolekcja.
Aktywuj — kliknij przycisk Aktywuj w kolumnie Aktywny, aby przełączyć aktywną kolekcję. Aktywować można wyłącznie kolekcje, których skrapowanie zostało zakończone.
Otwórz — kolumna Otwórz zawiera dwa przyciski:
- Przeglądaj (ikona listy) — otwiera stronę szczegółów kolekcji z listą wszystkich pobranych stron. Szczegóły w Przeglądanie treści.
- Szukaj (ikona wyszukiwania) — otwiera wyszukiwanie semantyczne po treści kolekcji. Szczegóły w Testowanie wyszukiwania.
Akcje — kolumna Akcje oferuje dodatkowe operacje:
- Cancel — zatrzymuje skrapowanie, które jest jeszcze w toku.
- Delete — usuwa kolekcję. Ta akcja jest niedostępna dla aktywnej kolekcji oraz dla kolekcji, których skrapowanie jest jeszcze w toku.
Monitorowanie statusu pipeline
Po rozpoczęciu skrapowania możesz monitorować jego postęp w czasie rzeczywistym w portalu. Pipeline wyświetla bieżący etap przetwarzania wraz ze statystykami, takimi jak liczba odkrytych stron, przetworzonych stron i napotkanych błędów. Widok postępu można odświeżyć klikając przycisk odświeżania nad tabelą, obok przycisku Run scraping.
Etapy skrapowania
Pipeline skrapowania składa się z kilku etapów uruchamianych kolejno:
-
Crawling — Scraper odwiedza skonfigurowane adresy URL i podąża za linkami, aby odkryć strony w obrębie witryny. Na tym etapie buduje mapę wszystkich stron do przetworzenia i pobiera ich zawartość HTML.
-
Extracting — Dla każdej odkrytej strony scraper stosuje konfigurację selektorów CSS, aby wyodrębnić istotną treść tekstową. Usuwa tagi HTML, pomija wykluczone elementy i tworzy czysty tekst reprezentujący merytoryczną zawartość każdej strony.
-
Embedding — Wyodrębniony tekst jest dzielony na fragmenty i przetwarzany przez model embeddingowy w celu wygenerowania reprezentacji wektorowych. Te embeddingi umożliwiają wyszukiwanie semantyczne, pozwalając AI znajdować treści na podstawie znaczenia, a nie tylko dopasowania słów kluczowych.
Po pomyślnym zakończeniu wszystkich etapów nowa kolekcja jest gotowa do aktywacji. Po jej aktywowaniu odwiedzający korzystający z widgetu od razu otrzymają wyniki z nowej treści.
Obsługa błędów
Podczas skrapowania niektóre strony mogą nie zostać przetworzone z powodu błędów sieciowych, przekroczeń czasu, błędów serwera lub nieoczekiwanych struktur strony. Pipeline raportuje te błędy i kontynuuje przetwarzanie pozostałych stron. Po zakończeniu przebiegu możesz przejrzeć listę błędów, aby zidentyfikować problematyczne strony.
Typowe błędy to strony zwracające kody HTTP 404 lub 500, strony ładujące się zbyt długo lub strony o nietypowej strukturze HTML, której ekstraktor treści nie potrafi przetworzyć. W przypadku powtarzających się błędów sprawdź, czy dotknięte strony są dostępne w zwykłej przeglądarce, i w razie potrzeby dostosuj konfigurację skrapowania. Strony, których nie udało się przetworzyć, są wykluczone z bazy wiedzy, ale nie blokują pomyślnego zakończenia reszty przebiegu.