Przeglądaj treści

Po zakończeniu skrapowania możesz przeglądać i zarządzać kolekcjami pobranych treści bezpośrednio w portalu zarządzania. Sekcja przeglądania treści daje pełny wgląd w to, jakie dane zostały wyekstrahowane z Twojej witryny i jak są one wykorzystywane przez moduł wyszukiwania AI.

Browse Content

Kolekcje treści

Każde uruchomienie skrapowania tworzy nową, niezależną kolekcję treści. Kolekcje nie są modyfikowane po utworzeniu. W portalu zarządzania przejdź do swojego projektu i otwórz sekcję Knowledge base -> Browse. Znajdziesz tam listę kolekcji z informacjami o dacie utworzenia, liczbie stron i statusie przetwarzania. Możesz przechowywać wiele kolekcji i przełączać się między nimi, aktywując wybraną. Tylko aktywna kolekcja dostarcza wyniki odwiedzającym witrynę.

Podgląd wyekstrahowanego tekstu

Dla każdej pobranej strony możesz wyświetlić wyekstrahowany tekst, który został przetworzony i zaindeksowany. Podgląd pozwala zweryfikować, czy selektory CSS prawidłowo identyfikują istotną treść i czy nie zostały pominięte ważne fragmenty. Wyświetlany jest zarówno surowy tekst po ekstrakcji, jak i podzielone fragmenty (chunki), które są używane w indeksie wyszukiwania. Jeśli zauważysz, że ekstrakcja nie obejmuje ważnych treści, wróć do konfiguracji skrapowania i dostosuj selektory.

Filtrowanie według statusu

Lista pobranych stron może być filtrowana według statusu przetwarzania. Dostępne statusy obejmują: pomyślnie przetworzone, z błędami, oczekujące na przetworzenie oraz wykluczone. Filtrowanie według statusu pozwala szybko zidentyfikować strony, które wymagają uwagi, na przykład te, które nie zostały poprawnie pobrane lub przetworzone. Możesz również wyszukiwać strony po adresie URL lub fragmencie tytułu.