Probador de fragmentación

Free, no signup. AI answer engines don't read your page — they read chunks of it, stripped of surrounding context, and a well-written page can still retrieve badly once it's been split that way. See how yours splits, and which chunks would confuse a retrieval system. Pairs with the chunking guide.

Chunking strategies
StrategyBest forTrade-off
Structure Headed documentsKeeps semantic sections together
Fixed Simple baselineCan split lists and ideas
Paragraph Short-answer contentLess surrounding context

Note: every retrieval system chunks differently — this models a common structure-aware strategy so you can spot problems, not reproduce one vendor exactly. Token counts are a chars/4 estimate. Pasted content never leaves your browser.

Se ejecuta por completo en tu navegador: nada de lo que pegues se sube ni se almacena. Fetch a URL sends only that address to our server to retrieve the HTML; extraction and chunking still happen in your browser. Los contadores anónimos de resultados por ejecución pueden utilizarse para investigación agregada; nunca incluyen URL, dominios, IP ni identificadores, y no se publica ninguna estadística con menos de 100 ejecuciones.

Comentarios
Informar de un error

¿Algo no funciona en Probador de fragmentación? Cuéntanos qué ha ocurrido. El informe va directamente a una cola privada de revisión, no a una lista pública.

Datos que se enviarán
 No se adjuntan automáticamente entradas de la herramienta, archivos subidos, fuentes pegadas, resultados completos, parámetros de consulta ni fragmentos de URL. Puedes editar o eliminar arriba el pasaje seleccionado. Los metadatos del navegador y de protección contra abusos se procesan para prevenir spam. 

Acerca de esta herramienta

Gratis y sin registro. Los motores de respuestas de IA no leen siempre una página completa: recuperan fragmentos separados de su contexto. Incluso una página bien escrita puede resultar difícil de recuperar después de dividirla.

Comprueba cómo se separa el contenido en chunks y dónde un fragmento puede resultar ambiguo fuera de contexto.

Funciones

  • División sensible a la estructura que agrupa bloques bajo el heading más cercano y mantiene los encabezados junto al contenido que describen.
  • Tamaño objetivo ajustable de 100 a 800 tokens y solapamiento de 0% a 40%; los chunks se recalculan al mover los controles.
  • Cada tarjeta muestra la ruta de headings, el número de palabras y tokens y una barra de tamaño que advierte cuando el bloque queda fuera del intervalo elegido.
  • Cinco alertas por chunk: demasiado largo, sin heading, apertura dependiente, estructura dividida y heading huérfano, con orientación específica para la revisión.

Cómo funciona

Un chunk es un fragmento de unos cientos de tokens agrupado bajo el heading más cercano que un sistema puede almacenar y recuperar en lugar de la página completa. La herramienta extrae bloques legibles, conserva la jerarquía de encabezados, aplica el tamaño y solapamiento seleccionados y señala los fragmentos que pierden contexto o estructura al aislarse.

Limitaciones

  • Cada sistema de recuperación divide el contenido de una forma diferente. Esta herramienta representa una estrategia habitual sensible a la estructura, no el chunking exacto de un proveedor.
  • Al pegar contenido, la extracción y división se ejecutan por completo en el navegador. Solo el modo opcional Recuperar una URL llama a un endpoint para obtener la página pública; no se almacena nada en ninguno de los modos.

Preguntas frecuentes

¿Qué es un fragmento de contenido en la búsqueda con IA?

Es un pasaje breve, normalmente de unos cientos de unidades de texto bajo el encabezado más cercano, que un sistema de recuperación almacena y consulta en lugar de la página completa. Ante una pregunta, recupera y cita los fragmentos individuales que mejor coinciden. Si uno no se entiende de forma aislada, es menos probable que se recupere o cite aunque la página completa sea excelente.

¿Cuántas unidades de texto debe tener un fragmento?

No hay una cifra general porque cada sistema divide el contenido de forma distinta. La herramienta usa como valor inicial 300 unidades con un 15 % de solapamiento y permite ajustar entre 100 y 800. Marca un fragmento como demasiado largo al superar 1,3 veces el objetivo, porque probablemente se truncará. La cifra se estima dividiendo los caracteres entre cuatro; no procede de un tokenizador efectivo.

¿Por qué se marca un inicio sin contexto?

Se marca cuando la primera frase empieza con una palabra dependiente del contexto, como un pronombre o una continuación del tipo esto, ello, sin embargo o por tanto. Esas palabras remiten a texto que puede estar en otro fragmento y el pasaje deja de sostenerse solo. Corrígelo con una frase temática independiente que nombre su sujeto.

¿La herramienta replica un proveedor concreto como Google?

No. Modela una estrategia habitual que respeta la estructura: agrupa bloques bajo el encabezado más cercano, los empaqueta en ventanas de tamaño limitado con solapamiento y no separa un encabezado de su primer párrafo. Busca detectar pasajes problemáticos en casi cualquier sistema, no replicar exactamente un proveedor. Los límites son representativos.

¿Mi contenido se envía a algún lugar cuando lo pego?

No. En el modo de pegado, la extracción y división se ejecutan por completo en el navegador y no se sube nada. Solo el modo opcional para obtener una URL llama a un punto del servidor, que solicita la página pública indicada, no el texto pegado. Ninguno de los modos almacena el contenido.

Siguiente pasoReescritor para citabilidad y conservación de entidades — generate the corrected version. La orientación está disponible en inglés.