Testador de chunks

Free, no signup. AI answer engines don't read your page — they read chunks of it, stripped of surrounding context, and a well-written page can still retrieve badly once it's been split that way. See how yours splits, and which chunks would confuse a retrieval system. Pairs with the chunking guide.

Chunking strategies
StrategyBest forTrade-off
Structure Headed documentsKeeps semantic sections together
Fixed Simple baselineCan split lists and ideas
Paragraph Short-answer contentLess surrounding context

Note: every retrieval system chunks differently — this models a common structure-aware strategy so you can spot problems, not reproduce one vendor exactly. Token counts are a chars/4 estimate. Pasted content never leaves your browser.

Executado inteiramente no seu navegador — nada do que você cola é enviado ou armazenado. Fetch a URL sends only that address to our server to retrieve the HTML; extraction and chunking still happen in your browser. Contadores anônimos de resultados por execução podem ser usados em pesquisas agregadas; URLs, domínios, IPs e identificadores nunca são incluídos, e nenhuma estatística é divulgada com menos de 100 execuções.

Comentários
Relatar um erro

Algo não está funcionando no Testador de chunks? Conte o que aconteceu — o relato vai direto para uma fila privada de triagem, não para uma lista pública.

O que será enviado
 Entradas da ferramenta, uploads, fonte colada, resultados completos, parâmetros de consulta e fragmentos de URL não são anexados automaticamente. Você pode editar ou remover o trecho selecionado acima. Metadados do navegador e de proteção contra abuso são processados para prevenir spam. 

Sobre esta ferramenta

Grátis e sem cadastro. Os mecanismos de resposta por IA não leem sua página inteira: eles leem blocos separados do contexto ao redor. Até uma página bem escrita pode ter baixa recuperação depois de dividida.

Veja como seu conteúdo é separado em blocos e onde a recuperação pode confundir um trecho.

Recursos

  • Divisão sensível à estrutura, que agrupa blocos sob o heading mais próximo e mantém os headings com seus
  • Tamanho-alvo ajustável (100–800 tokens) e sobreposição (0–40%): os blocos são recalculados enquanto você move os controles.
  • Cada cartão de bloco mostra a trilha de headings, a contagem de palavras e tokens e uma barra de tamanho que fica âmbar quando o bloco
  • Cinco alertas por bloco (longo demais, sem heading, abertura dependente, estrutura dividida e heading órfão), com uma

Como funciona

Um bloco é um pequeno trecho — geralmente algumas centenas de tokens agrupados sob o heading mais próximo — que um sistema de recuperação armazena e pesquisa em vez da página inteira. Quando alguém faz uma pergunta a um mecanismo de resposta por IA, ele recupera e cita os blocos individuais mais correspondentes, não o URL completo. Se um bloco não fizer sentido isoladamente, terá menos chance de ser recuperado ou citado, mesmo que a página ao redor seja excelente.

Limitações

  • Observação: cada sistema de recuperação divide o conteúdo de forma diferente; esta ferramenta representa uma estratégia comum sensível à estrutura.
  • Não. No modo de colagem, a extração e a divisão são executadas inteiramente no navegador, sem upload. Apenas o modo opcional “Buscar um URL” chama um endpoint do servidor, que busca a página pública informada, não o texto colado. Nada é armazenado em nenhum dos modos.

Perguntas frequentes

O que é um trecho de conteúdo na pesquisa por IA?

Um trecho é um pequeno trecho — geralmente algumas centenas de elementos técnicos agrupados sob o título mais próximo — que um sistema de recuperação armazena e pesquisa em vez da página inteira. Quando alguém faz uma pergunta a um mecanismo de respostas com IA, ele recupera e cita os trechos individuais mais correspondentes, não a URL completa. Se um trecho não fizer sentido sozinho, é menos provável que seja recuperado ou citado, mesmo que a página ao redor seja excelente.

Quantos elementos técnicos um trecho deve ter? <!--How many tokens should a chunk be?-->

Não existe um número geral, pois cada sistema de recuperação divide o conteúdo de forma diferente. Esta ferramenta usa por padrão uma meta de 300 elementos técnicos com 15% de sobreposição, um ponto intermediário comum, e permite ajustar a meta de 100 a 800 elementos técnicos. Ela sinaliza um trecho como “longo demais” quando ultrapassa 1,3× a meta, pois nesse caso um recuperador provavelmente o truncará. O número de elementos técnicos é uma estimativa de caracteres/4, não uma contagem de um tokenizador verdadeiro. <!--There is no universal number because every retrieval system chunks differently. This tool defaults to a 300-token target with 15% overlap, which is a common middle ground, and lets you slide the target from 100 to 800 tokens. It flags a chunk as "too long" once it passes 1.3× your target, since a retriever is then likely to truncate it. The token figure is a chars/4 estimate, not a real tokenizer count.-->

Por que um trecho recebe a sinalização “abertura dependente”?

A ferramenta sinaliza trechos cuja primeira frase começa com uma palavra dependente de contexto — um pronome ou uma continuação isolada como “isto”, “ele”, “eles”, “porém” ou “portanto”. Essas palavras remetem a um texto que pode estar em outro trecho, de modo que o trecho perde o sentido quando é recuperado fora da página. A correção é iniciar a seção com uma frase temática autossuficiente que nomeie seu assunto.

O Testador de Chunks reproduz um fornecedor específico, como Google ou OpenAI?

Não. Ele modela uma estratégia comum de divisão sensível à estrutura — agrupa blocos sob o título mais próximo, acomoda-os em janelas de tamanho definido por tokens com sobreposição e nunca separa um título do primeiro parágrafo. O objetivo é revelar trechos que seriam mal recuperados em quase qualquer sistema, não reproduzir exatamente um fornecedor. Trate os limites dos chunks como representativos, não idênticos aos de um mecanismo específico.

Meu conteúdo é enviado para algum lugar quando eu o colo?

Não. No modo de colagem, a extração e a divisão em chunks ocorrem inteiramente no navegador, e nada é enviado. Apenas o modo opcional “Buscar uma URL” chama um endpoint do servidor, que busca a página pública indicada, não o texto colado. Nada é armazenado em nenhum dos modos.

Próxima etapaReescritor que preserva citabilidade e entidades — generate the corrected version. Orientações disponíveis em inglês.