XML 사이트맵 생성기
Bounded and polite: at most three page requests run at once; each request is capped at 900 KB/10 seconds, and the server also rate-limits each target host. This is a sitemap seed, not a full-site crawler.
검사는 당사 서버에서 실행됩니다. 입력한 URL을 가져오지만 결과는 보관하지 않습니다. The start site, its robots.txt, and eligible same-host HTML pages are sent through this site's bounded fetch endpoints. Crawl decisions and XML generation run in your browser. 익명 실행별 결과 계수는 종합 연구에 사용될 수 있습니다. URL, 도메인, IP 및 식별자는 절대 포함되지 않으며 100회 미만의 실행에 대한 통계는 공개하지 않습니다.
+를 눌러 현재 사이트 또는 페이지를 저장합니다. 저장된 사이트, 페이지 또는 목록 옆의 ☆를 사용해 즐겨찾기에 추가하세요. 최근 검사 기록은 아래에 표시됩니다.
이름 있는 목록 만들기
로컬 선택에서 대상을 입력했습니다.
사이트 패스포트 이 저장된 사이트의 로컬 컨텍스트
로컬 데이터
저장된 대상, 이름 있는 목록 및 최근 검사 요약은 이 브라우저에만 남습니다.
Sitemap output
Excluded
Unknown / not included
이 도구 평가하기
이 도구 정보
같은 site를 제한적으로 crawl하고 robots.txt를 존중해 정직한 XML sitemap을 생성합니다. noindex와 off-canonical URL은 제외하며 failed, non-HTML, truncated 또는 non-success response는 별도의 unknown state로 유지합니다.
crawl은 sitemap seed이지 전체 site crawler가 아닙니다. page limit에 도달했을 때 queue가 남아 있다면 complete라고 표시하지 않습니다.
기능
- robots.txt를 존중하고 최대 200 page까지 선택할 수 있는 bounded same-site crawl
- noindex, off-canonical과 Googlebot-disallowed URL 제외
- failed, non-HTML, truncated와 uncertain response의 별도 state
- visible header·datetime·JSON-LD evidence가 있을 때만 lastmod 출력 및 XML validation link
작동 방식
start URL과 page limit을 입력합니다. crawler는 robots.txt를 검사하고 같은 site link만 따라가며 canonical, noindex, HTTP status, Content-Type과 size limit을 수집합니다. 포함된 page의 lastmod는 유효한 Last-Modified header, visible time datetime 또는 JSON-LD dateModified·datePublished에서만 가져온 뒤 XML sitemap을 생성해 validation 단계로 보냅니다.
제한사항
- 최대 200 page만 crawl하므로 limit에서 queue가 비어 있지 않으면 더 많은 URL이 검사되지 않은 상태입니다.
- request당 900 KB와 10초 제한, 최대 3개 병렬 request 및 target host별 rate limit이 적용됩니다.
- lastmod를 오늘 날짜로 일괄 설정하지 않으며 검증 가능한 evidence가 없으면 날짜를 생략합니다.
자주 묻는 질문
사이트 전체를 크롤링하나요?
아니요. 최대 200페이지의 엄격한 한도를 선택합니다. 한도에 도달했을 때 대기열이 남아 있으면 이를 표시하므로 제한된 크롤링을 완료된 것으로 제시하지 않습니다.
어떤 페이지가 제외되나요?
noindex 헤더나 메타 태그가 있는 페이지, canonical이 다른 곳을 가리키는 페이지, robots.txt에서 Googlebot에 허용되지 않은 URL을 제외합니다. 실패, 비HTML, 잘린 응답, 2xx가 아닌 응답은 별도의 알 수 없음 상태로 둡니다.
lastmod는 어떻게 선택하나요?
유효한 HTTP Last-Modified 헤더, 보이는 time 요소의 datetime, 또는 JSON-LD의 dateModified/datePublished 값만 출력합니다. 모든 페이지에 오늘 날짜를 찍지 않습니다.
자주 발생하는 문제와 해결 방법
- 경고 Noindex 페이지가 사이트맵에서 제외됩니다 해결 방법: 페이지를 색인해야 한다면 noindex를 제거하고, 그렇지 않으면 사이트맵에서 제외된 상태를 유지하세요.
- 경고 200이 아닌 페이지가 사이트맵에서 제외됩니다 해결 방법: 정규 페이지에 직접 200 응답을 복원하거나 200이 아닌 URL을 사이트맵에서 제외하세요.
- 경고 다른 곳을 정규화하는 페이지가 제외됩니다 해결 방법: 정규 대상만 포함하고 다른 곳으로 정규화된 URL은 사이트맵에서 제외하세요.
- 정보 중복 URL이 제거됩니다 해결 방법: 정규화된 정규 URL 항목 하나를 유지하고 중복 표기나 매개변수 변형을 제거하세요.
- 경고 유효하지 않은 URL이 제외됩니다 해결 방법: 사이트맵에 추가하기 전에 잘못된 절대 URL을 수정하세요.
- 경고 교차 호스트 URL이 제외됩니다 해결 방법: 검증된 다른 호스트에는 별도 사이트맵을 생성하고 이 사이트맵은 해당 호스트 전용으로 유지하세요.