청크 검사기
Free, no signup. AI answer engines don't read your page — they read chunks of it, stripped of surrounding context, and a well-written page can still retrieve badly once it's been split that way. See how yours splits, and which chunks would confuse a retrieval system. Pairs with the chunking guide.
| Strategy | Best for | Trade-off |
|---|---|---|
| Structure | Headed documents | Keeps semantic sections together |
| Fixed | Simple baseline | Can split lists and ideas |
| Paragraph | Short-answer content | Less surrounding context |
Note: every retrieval system chunks differently — this models a common structure-aware strategy
so you can spot problems, not reproduce one vendor exactly. Token counts are a chars/4 estimate.
Pasted content never leaves your browser.
We fetch the page’s HTML and extract its main text in your browser. Client-rendered (JS-only) pages may extract little — paste in that case.
전체 과정이 브라우저에서 실행되며, 붙여넣은 내용은 업로드되거나 저장되지 않습니다. Fetch a URL sends only that address to our server to retrieve the HTML; extraction and chunking still happen in your browser. 익명 실행별 결과 계수는 종합 연구에 사용될 수 있습니다. URL, 도메인, IP 및 식별자는 절대 포함되지 않으며 100회 미만의 실행에 대한 통계는 공개하지 않습니다.
이 도구 평가하기
이 도구 정보
AI 답변 시스템이 가져오고 인용할 수 있도록 검색 시스템이 콘텐츠를 어떤 chunk로 나눌지 살펴봅니다. 색상 band, 문자·token 추정값과 함께 지나치게 긴 chunk, heading context 누락, 고립된 대명사, 분리된 표·목록을 표시합니다.
경계와 점수는 투명한 휴리스틱이며 특정 provider의 tokenizer나 retrieval·ranking 동작을 재현하지 않습니다.
기능
- article text, Markdown 또는 원시 HTML 붙여 넣기와 선택형 공개 URL 가져오기
- 가장 가까운 heading과 block 경계를 보존하는 structure-aware chunking
- 조정 가능한 chunk size와 overlap, 문자·token 추정값 및 색상 band
- too long, missing heading, dangling opener, split structure와 orphaned heading의 5개 결과 유형
작동 방식
parser가 heading, paragraph, list와 table을 구조 block으로 인식하고 목표 크기와 overlap에 따라 묶습니다. 각 chunk에 heading context를 연결하고 길이, 시작 대명사와 분리된 구조를 포함한 5개 규칙을 적용합니다. 결과는 콘텐츠 구조를 고치는 용도로 검토해야 합니다.
제한사항
- 실제 Google, OpenAI 또는 다른 provider는 서로 다른 tokenizer, 경계와 ranking logic을 사용할 수 있습니다.
- token 수는 문자 수를 4로 나눈 방향성 추정값이며 특정 tokenizer의 정확한 계산이 아닙니다.
- URL 모드는 공개 콘텐츠만 제한적으로 가져옵니다. JavaScript로만 렌더링되는 페이지는 콘텐츠를 직접 붙여 넣어야 할 수 있습니다.
자주 묻는 질문
AI 검색에서 콘텐츠 조각이란 무엇인가요?
전체 페이지 대신 검색 시스템이 저장하고 찾는 작은 구절로, 보통 가장 가까운 제목 아래 수백 개 토큰을 묶습니다. 질문이 들어오면 답변 엔진은 전체 URL이 아니라 가장 잘 맞는 개별 조각을 찾아 인용합니다. 조각만 떼어 읽었을 때 이해하기 어려우면 주변 페이지가 훌륭해도 검색되거나 인용될 가능성이 낮습니다.
콘텐츠 조각은 몇 토큰이 적당한가요?
검색 시스템마다 나누는 방식이 달라 보편적인 수치는 없습니다. 기본값은 흔한 중간값인 목표 300토큰과 15% 중첩이며 목표를 100~800으로 바꿀 수 있습니다. 목표의 1.3배를 넘으면 검색기가 잘라낼 가능성이 있어 너무 김으로 표시합니다. 토큰 수는 실제 토크나이저가 아니라 문자 수를 4로 나눈 추정치입니다.
조각에 맥락 없는 시작 경고가 붙는 이유는 무엇인가요?
첫 문장이 이것, 그것, 그러나, 따라서처럼 앞 문맥에 의존하는 대명사나 연결어로 시작할 때 표시됩니다. 가리키는 텍스트가 다른 조각에 있을 수 있어 검색 결과로 분리되면 독립적으로 이해되지 않습니다. 주어를 명시한 독립적인 주제 문장으로 섹션을 시작하세요.
이 도구가 특정 검색 또는 AI 업체의 방식을 재현하나요?
아니요. 가장 가까운 제목 아래 블록을 묶고, 중첩된 토큰 크기 창에 채우며, 제목과 첫 문단을 나누지 않는 일반적인 구조 인식 전략 하나를 모델링합니다. 특정 업체를 복제하는 것이 아니라 거의 모든 시스템에서 검색이 어려울 구절을 찾는 것이 목적입니다. 경계는 대표적인 예일 뿐 어느 엔진과도 동일하지 않습니다.
붙여 넣은 콘텐츠가 다른 곳으로 전송되나요?
아니요. 붙여 넣기 모드의 추출과 분할은 브라우저에서 실행되며 업로드되지 않습니다. 선택 사항인 URL 가져오기 모드만 서버 엔드포인트를 호출하며, 붙여 넣은 텍스트가 아니라 지정한 공개 페이지를 가져옵니다. 어느 경우에도 저장하지 않습니다.
자주 발생하는 문제와 해결 방법
- 오류 핵심 답변이 여러 chunk로 나뉘었습니다 해결 방법: 전체 답변을 하나의 chunk로 옮기거나 경계에서 필수 맥락을 반복하세요.
- 경고 Chunk에 인접한 보조 맥락이 부족합니다 해결 방법: Chunk가 독립적으로 의미를 유지하는 데 필요한 인접 정의, entity 또는 조건을 추가하세요.
- 경고 청크에 제목 맥락이 없습니다 해결 방법: 가장 가까운 설명형 제목을 청크 메타데이터나 텍스트에 포함하세요.
- 경고 Chunk가 맥락 의존적인 표현으로 시작합니다 해결 방법: 대명사나 앞선 콘텐츠 참조로 시작하지 말고 주제를 직접 명시하도록 첫 문장을 다시 작성하세요.
- 경고 목록 또는 표 구조가 여러 chunk로 나뉘었습니다 해결 방법: 목록이나 표의 heading과 모든 행을 같은 chunk에 유지하세요.
- 경고 Heading이 해당 콘텐츠와 분리되었습니다 해결 방법: 청크 경계를 조정해 제목을 첫 번째 주요 문단과 결합하세요.