청크 검사기

Free, no signup. AI answer engines don't read your page — they read chunks of it, stripped of surrounding context, and a well-written page can still retrieve badly once it's been split that way. See how yours splits, and which chunks would confuse a retrieval system. Pairs with the chunking guide.

Chunking strategies
StrategyBest forTrade-off
Structure Headed documentsKeeps semantic sections together
Fixed Simple baselineCan split lists and ideas
Paragraph Short-answer contentLess surrounding context

Note: every retrieval system chunks differently — this models a common structure-aware strategy so you can spot problems, not reproduce one vendor exactly. Token counts are a chars/4 estimate. Pasted content never leaves your browser.

전체 과정이 브라우저에서 실행되며, 붙여넣은 내용은 업로드되거나 저장되지 않습니다. Fetch a URL sends only that address to our server to retrieve the HTML; extraction and chunking still happen in your browser. 익명 실행별 결과 계수는 종합 연구에 사용될 수 있습니다. URL, 도메인, IP 및 식별자는 절대 포함되지 않으며 100회 미만의 실행에 대한 통계는 공개하지 않습니다.

피드백
버그 신고

청크 검사기에서 문제가 발생했나요? 무슨 일이 있었는지 알려 주세요. 신고는 공개 목록이 아니라 비공개 분류 대기열로 바로 전송됩니다.

전송될 정보
 도구 입력, 업로드, 붙여넣은 소스, 전체 결과, 쿼리 매개변수 또는 URL 조각은 자동으로 첨부되지 않습니다. 위에서 선택한 구절을 수정하거나 삭제할 수 있습니다. 브라우저 및 악용 방지 메타데이터는 스팸 방지를 위해 처리됩니다. 

이 도구 정보

AI 답변 시스템이 가져오고 인용할 수 있도록 검색 시스템이 콘텐츠를 어떤 chunk로 나눌지 살펴봅니다. 색상 band, 문자·token 추정값과 함께 지나치게 긴 chunk, heading context 누락, 고립된 대명사, 분리된 표·목록을 표시합니다.

경계와 점수는 투명한 휴리스틱이며 특정 provider의 tokenizer나 retrieval·ranking 동작을 재현하지 않습니다.

기능

  • article text, Markdown 또는 원시 HTML 붙여 넣기와 선택형 공개 URL 가져오기
  • 가장 가까운 heading과 block 경계를 보존하는 structure-aware chunking
  • 조정 가능한 chunk size와 overlap, 문자·token 추정값 및 색상 band
  • too long, missing heading, dangling opener, split structure와 orphaned heading의 5개 결과 유형

작동 방식

parser가 heading, paragraph, list와 table을 구조 block으로 인식하고 목표 크기와 overlap에 따라 묶습니다. 각 chunk에 heading context를 연결하고 길이, 시작 대명사와 분리된 구조를 포함한 5개 규칙을 적용합니다. 결과는 콘텐츠 구조를 고치는 용도로 검토해야 합니다.

제한사항

  • 실제 Google, OpenAI 또는 다른 provider는 서로 다른 tokenizer, 경계와 ranking logic을 사용할 수 있습니다.
  • token 수는 문자 수를 4로 나눈 방향성 추정값이며 특정 tokenizer의 정확한 계산이 아닙니다.
  • URL 모드는 공개 콘텐츠만 제한적으로 가져옵니다. JavaScript로만 렌더링되는 페이지는 콘텐츠를 직접 붙여 넣어야 할 수 있습니다.

자주 묻는 질문

AI 검색에서 콘텐츠 조각이란 무엇인가요?

전체 페이지 대신 검색 시스템이 저장하고 찾는 작은 구절로, 보통 가장 가까운 제목 아래 수백 개 토큰을 묶습니다. 질문이 들어오면 답변 엔진은 전체 URL이 아니라 가장 잘 맞는 개별 조각을 찾아 인용합니다. 조각만 떼어 읽었을 때 이해하기 어려우면 주변 페이지가 훌륭해도 검색되거나 인용될 가능성이 낮습니다.

콘텐츠 조각은 몇 토큰이 적당한가요?

검색 시스템마다 나누는 방식이 달라 보편적인 수치는 없습니다. 기본값은 흔한 중간값인 목표 300토큰과 15% 중첩이며 목표를 100~800으로 바꿀 수 있습니다. 목표의 1.3배를 넘으면 검색기가 잘라낼 가능성이 있어 너무 김으로 표시합니다. 토큰 수는 실제 토크나이저가 아니라 문자 수를 4로 나눈 추정치입니다.

조각에 맥락 없는 시작 경고가 붙는 이유는 무엇인가요?

첫 문장이 이것, 그것, 그러나, 따라서처럼 앞 문맥에 의존하는 대명사나 연결어로 시작할 때 표시됩니다. 가리키는 텍스트가 다른 조각에 있을 수 있어 검색 결과로 분리되면 독립적으로 이해되지 않습니다. 주어를 명시한 독립적인 주제 문장으로 섹션을 시작하세요.

이 도구가 특정 검색 또는 AI 업체의 방식을 재현하나요?

아니요. 가장 가까운 제목 아래 블록을 묶고, 중첩된 토큰 크기 창에 채우며, 제목과 첫 문단을 나누지 않는 일반적인 구조 인식 전략 하나를 모델링합니다. 특정 업체를 복제하는 것이 아니라 거의 모든 시스템에서 검색이 어려울 구절을 찾는 것이 목적입니다. 경계는 대표적인 예일 뿐 어느 엔진과도 동일하지 않습니다.

붙여 넣은 콘텐츠가 다른 곳으로 전송되나요?

아니요. 붙여 넣기 모드의 추출과 분할은 브라우저에서 실행되며 업로드되지 않습니다. 선택 사항인 URL 가져오기 모드만 서버 엔드포인트를 호출하며, 붙여 넣은 텍스트가 아니라 지정한 공개 페이지를 가져옵니다. 어느 경우에도 저장하지 않습니다.

다음 단계인용 가능성 및 엔터티 보존 재작성기 — generate the corrected version. 안내는 영어로 제공됩니다.