Tester fragmentów

Free, no signup. AI answer engines don't read your page — they read chunks of it, stripped of surrounding context, and a well-written page can still retrieve badly once it's been split that way. See how yours splits, and which chunks would confuse a retrieval system. Pairs with the chunking guide.

Chunking strategies
StrategyBest forTrade-off
Structure Headed documentsKeeps semantic sections together
Fixed Simple baselineCan split lists and ideas
Paragraph Short-answer contentLess surrounding context

Note: every retrieval system chunks differently — this models a common structure-aware strategy so you can spot problems, not reproduce one vendor exactly. Token counts are a chars/4 estimate. Pasted content never leaves your browser.

Działa w całości w Twojej przeglądarce — nic, co wklejasz, nie jest przesyłane ani zapisywane. Fetch a URL sends only that address to our server to retrieve the HTML; extraction and chunking still happen in your browser. Anonimowe liczniki wyników poszczególnych uruchomień mogą być wykorzystywane do badań zbiorczych; adresy URL, domeny, adresy IP i identyfikatory nigdy nie są uwzględniane, a statystyki nie są publikowane poniżej 100 uruchomień.

Opinia
Zgłoś błąd

Coś nie działa w Tester fragmentów? Opisz, co się stało — zgłoszenie trafi bezpośrednio do prywatnej kolejki weryfikacji, a nie na publiczną listę.

Dane, które zostaną wysłane
 Dane wejściowe narzędzia, przesłane pliki, wklejone źródła, pełne wyniki, parametry zapytania i fragmenty URL nie są dołączane automatycznie. Możesz edytować lub usunąć zaznaczony powyżej fragment. Metadane przeglądarki i ochrony przed nadużyciami są przetwarzane w celu zapobiegania spamowi. 

O tym narzędziu

Wklej tekst lub adres URL, aby zobaczyć, jak system wyszukiwania informacji może podzielić zawartość na fragmenty wraz z kontekstem, liczbą tokenów, nakładaniem i ostrzeżeniami strukturalnymi.

Funkcje

  • Segmentacja uwzględniająca nagłówki i granice bloków treści.
  • Szacowanie tokenów, rozmiarów i nakładania z interaktywnymi kartami.
  • Ostrzeżenia dotyczące oderwanych wprowadzeń, brakującego kontekstu oraz przeciętych list i tabel.
  • Lokalne przetwarzanie w przeglądarce z opcjonalnym pobieraniem publicznego adresu URL.

Jak to działa

Tester wyodrębnia bloki, zachowuje najbliższy nagłówek jako kontekst i stosuje wybraną strategię segmentacji. Każdy fragment jest następnie sprawdzany według pięciu reguł kontekstu i struktury.

Ograniczenia

  • Segmentacja jest przybliżeniem kierunkowym i nie odtwarza algorytmu żadnego konkretnego dostawcy.
  • Strona renderowana wyłącznie przez JavaScript może dostarczyć niewiele tekstu podczas pobierania.
  • Progi tokenów nie dowodzą pozycji, cytowania ani jakości redakcyjnej.

Częste pytania

Czym jest fragment treści w wyszukiwaniu AI?

Fragment to mały ustęp, zwykle kilkaset tokenów zgrupowanych pod najbliższym nagłówkiem, który mechanizm wyszukiwania przechowuje i przeszukuje zamiast całej strony. Gdy ktoś zadaje pytanie silnikowi odpowiedzi AI, pobiera on najlepiej dopasowane pojedyncze fragmenty i cytuje je, a nie cały adres URL. Jeśli fragment źle brzmi samodzielnie, ma mniejszą szansę na pobranie lub cytowanie, nawet gdy reszta strony jest świetna.

Ile tokenów powinien mieć fragment?

Nie ma uniwersalnej liczby, bo każdy mechanizm dzieli treść inaczej. Narzędzie domyślnie przyjmuje cel 300 tokenów z 15% nakładaniem, co jest częstym kompromisem, i pozwala ustawić od 100 do 800 tokenów. Oznacza fragment jako zbyt długi po przekroczeniu 1,3× celu, bo mechanizm pobierający prawdopodobnie go wtedy przytnie. Liczba tokenów jest szacunkiem opartym na czterech znakach na jednostkę, nie wynikiem rzeczywistej tokenizacji.

Dlaczego fragment otrzymuje etykietę urwanego początku?

Narzędzie oznacza fragment, którego pierwsze zdanie zaczyna się od słowa zależnego od kontekstu, czyli zaimka lub kontynuacji typu „to”, „ono”, „oni”, „jednak” albo „dlatego”. Słowa te odsyłają do tekstu, który może znaleźć się w innym fragmencie, więc po wyciągnięciu ze strony ustęp nie jest samodzielny. Rozwiązaniem jest rozpoczęcie sekcji samodzielnym zdaniem tematycznym, które nazywa podmiot.

Czy narzędzie odtwarza konkretnego dostawcę, takiego jak Google lub OpenAI?

Nie. Modeluje jedną popularną strategię dzielenia z uwzględnieniem struktury: grupowanie bloków pod najbliższym nagłówkiem, pakowanie ich do okien o rozmiarze w tokenach z nakładaniem i nierozdzielanie nagłówka od pierwszego akapitu. Celem jest wskazanie ustępów, które byłyby źle pobierane w niemal każdym systemie, nie dokładne odtworzenie jednego dostawcy. Granice fragmentów traktuj jako reprezentatywne, nie identyczne z pojedynczym silnikiem.

Czy po wklejeniu treść jest gdzieś wysyłana?

Nie. W trybie wklejania wyodrębnianie i dzielenie odbywa się całkowicie w przeglądarce, bez przesyłania. Tylko opcjonalny tryb pobierania adresu URL wywołuje punkt końcowy serwera, który pobiera wskazaną publiczną stronę, a nie wklejony tekst. W żadnym trybie nic nie jest przechowywane.

Następny krokPrzeredagowywacz z zachowaniem cytowalności i encji — generate the corrected version. Wskazówki są dostępne po angielsku.