Penguji Chunk

Free, no signup. AI answer engines don't read your page — they read chunks of it, stripped of surrounding context, and a well-written page can still retrieve badly once it's been split that way. See how yours splits, and which chunks would confuse a retrieval system. Pairs with the chunking guide.

Chunking strategies
StrategyBest forTrade-off
Structure Headed documentsKeeps semantic sections together
Fixed Simple baselineCan split lists and ideas
Paragraph Short-answer contentLess surrounding context

Note: every retrieval system chunks differently — this models a common structure-aware strategy so you can spot problems, not reproduce one vendor exactly. Token counts are a chars/4 estimate. Pasted content never leaves your browser.

Berjalan sepenuhnya di browser Anda—tidak ada yang Anda tempel yang diunggah atau disimpan. Fetch a URL sends only that address to our server to retrieve the HTML; extraction and chunking still happen in your browser. Penghitung hasil anonim per proses dapat digunakan untuk riset agregat; URL, domain, IP, dan pengenal tidak pernah disertakan, dan statistik tidak dirilis jika jumlah proses kurang dari 100.

Masukan
Laporkan bug

Ada yang rusak di Penguji Chunk? Beri tahu kami apa yang terjadi—laporan ini langsung masuk ke antrean triase privat, bukan daftar publik.

Yang akan dikirim
 Input alat, unggahan, sumber yang ditempel, hasil lengkap, parameter kueri, dan fragmen URL tidak dilampirkan secara otomatis. Anda dapat mengedit atau menghapus kutipan yang dipilih di atas. Metadata browser dan antipenyalahgunaan diproses untuk mencegah spam. 

Tentang alat ini

apakah jawaban mesin akan sebenarnya rank atau cite mereka.

pertama paragraph.

Structure-aware chunking yang groups memblokir di bawah nearest heading dan mempertahankan headings dengan mereka

Fitur

  • Dangling opener (hard) — dimulai dengan pronoun atau bare continuation (ini, ini, mereka,
  • Tidak ada heading (hard) — tidak ada heading di atau di atas chunk, so retriever dapat't easily rank atau
  • band untuk chunk-nya card.
  • kolom. Hover apa pun chunk card untuk highlight exactly yang teks ini covers di banded preview pada left.
  • Tempel teks/Markdown/HTML, atau ambil publik URL dan mengekstrak utama-nya konten.

Cara kerja

memblokir dan ditampilkan sebagai striped band; tetap windows overlap di karakter boundaries. URL ambil membaca server-dirender HTML hanya: klien-dirender (JS-hanya) halaman mungkin mengekstrak little, so N dengan masalah — bagaimana banyak chunks carry di least satu flag. Unduh chunk CSV spesifik perbaikan pada setiap.

Batasan

  • Catatan: setiap retrieval system chunks secara berbeda — ini models umum structure-aware strategy
  • Berjalan klien-side untuk ditempel konten — tidak ada adalah diunggah atau disimpan.
  • Bagaimana banyak tokens seharusnya chunk menjadi?
  • Colored preview bands yang peta setiap chunk untuk tepat teks ini covers, dengan hover-untuk-highlight linking

Pertanyaan umum

Pertanyaan: Apa itu potongan konten dalam pencarian AI?

Jawaban: potongan adalah bagian kecil, biasanya beberapa ratus unit teks yang dikelompokkan di bawah judul bagian terdekat, yang disimpan dan ditelusuri sistem pengambilan sebagai pengganti seluruh halaman. Saat seseorang bertanya kepada mesin jawaban AI, sistem mengambil potongan individu yang paling cocok dan mengutipnya, bukan seluruh URL. Jika sebuah potongan sulit dipahami secara mandiri, kemungkinan diambil atau dikutip lebih kecil walaupun halaman di sekitarnya sangat baik.

Pertanyaan: Berapa banyak unit teks yang sebaiknya dimiliki sebuah potongan?

Jawaban: Tidak ada angka menyeluruh karena setiap sistem pengambilan membagi konten secara berbeda. Alat secara default menargetkan 300 unit teks dengan tumpang tindih 15%, sebuah nilai tengah yang umum, dan memungkinkan target 100 hingga 800 unit teks. potongan ditandai “terlalu panjang” setelah melewati 1,3× target karena pengambil kemungkinan akan memotongnya. Angka unit teks adalah estimasi karakter/4, bukan hitungan pemecah teks nyata.

Pertanyaan: Mengapa potongan mendapat tanda “tergantung pembuka”?

Jawaban: Alat menandai potongan yang kalimat pertamanya dimulai dengan kata bergantung konteks, yaitu kata ganti atau sambungan seperti “ini”, “it”, “mereka”, “namun”, atau “karena itu”. Kata tersebut merujuk ke teks yang mungkin berada di potongan lain, sehingga bagian tidak berdiri sendiri ketika pengambilan mengeluarkannya dari halaman. Perbaikannya adalah membuka bagian dengan kalimat topik mandiri yang menyebut subjeknya.

Pertanyaan: Apakah potongan penguji mereproduksi penyedia tertentu seperti Google atau OpenAI?

Jawaban: Tidak. Alat memodelkan satu strategi pemotongan sadar struktur yang umum: mengelompokkan blok di bawah judul bagian terdekat, memasukkannya ke jendela berukuran unit teks dengan tumpang tindih, dan tidak pernah memisahkan judul bagian dari paragraf pertamanya. Tujuannya menemukan bagian yang akan sulit diambil oleh hampir semua sistem, bukan mereproduksi satu penyedia secara persis. Anggap batas potongan representatif, bukan identik dengan satu mesin.

Pertanyaan: Apakah konten saya dikirim ke mana pun saat ditempel?

Jawaban: Tidak. Dalam modus tempel, ekstraksi dan pemotongan berjalan sepenuhnya di peramban dan tidak ada yang diunggah. Hanya modus opsional “ambil a URL” yang memanggil titik akhir server, dan titik akhir tersebut mengambil halaman publik yang Anda sebutkan, bukan teks yang ditempel. Tidak ada yang disimpan pada kedua cara tersebut.

Langkah berikutnyaPenulis Ulang Keterkutipan — generate the corrected version. Panduan tersedia dalam bahasa Inggris.