robots.txt 검사기

1. robots.txt
2. Pages to test
3. Bots

전체 과정이 브라우저에서 실행되며, 붙여넣은 내용은 업로드되거나 저장되지 않습니다. The server is only used to fetch a site's robots.txt or sitemap (browsers can't — no CORS). 익명 실행별 결과 계수는 종합 연구에 사용될 수 있습니다. URL, 도메인, IP 및 식별자는 절대 포함되지 않으며 100회 미만의 실행에 대한 통계는 공개하지 않습니다.

피드백
버그 신고

robots.txt 검사기에서 문제가 발생했나요? 무슨 일이 있었는지 알려 주세요. 신고는 공개 목록이 아니라 비공개 분류 대기열로 바로 전송됩니다.

전송될 정보
 도구 입력, 업로드, 붙여넣은 소스, 전체 결과, 쿼리 매개변수 또는 URL 조각은 자동으로 첨부되지 않습니다. 위에서 선택한 구절을 수정하거나 삭제할 수 있습니다. 브라우저 및 악용 방지 메타데이터는 스팸 방지를 위해 처리됩니다. 

이 도구 정보

여러 URL과 user-agent를 robots.txt 규칙에 대입해 허용 또는 차단 결과와 실제로 승리한 규칙을 확인합니다. 현재 파일을 린트하고 사이트맵 충돌을 찾으며, 제안 파일과의 차이도 비교할 수 있습니다.

붙여 넣은 내용은 브라우저에서 분석되고, 라이브 모드는 입력한 각 origin의 robots.txt를 제한된 엔드포인트로 별도로 가져옵니다.

기능

  • Google 오픈 소스 파서에서 포팅한 가장 구체적인 경로 우선 매칭과 Allow·Disallow 판정
  • 여러 URL과 검색·AI 크롤러를 교차 확인하는 매트릭스 및 각 셀의 승리 규칙 근거
  • 구문 린트, Sitemap 선언 충돌, 상태 코드 의미와 현재·제안 파일 diff
  • 최대 10개 origin을 분리해 라이브 robots.txt를 가져오고 각 파일의 결과를 독립적으로 표시

작동 방식

도구는 user-agent 그룹을 해석하고 와일드카드와 하위 에이전트 상속을 반영한 뒤 가장 긴 일치 경로를 선택합니다. 각 URL에 상태 코드 의미와 파일 규칙을 적용해 승리한 줄을 근거로 반환하며, 제안 모드에서는 같은 입력에 두 파일을 적용해 판정 차이를 보여 줍니다.

제한사항

  • Disallow는 크롤링을 막을 뿐 색인을 제거하지 않습니다. 차단된 페이지의 noindex는 크롤러가 볼 수 없습니다.
  • robots.txt 준수는 자발적이며 접근 제어 수단이 아닙니다. Google과 다른 매칭 방식을 쓰는 크롤러도 있습니다.
  • 라이브 가져오기는 공개 origin과 제한된 응답만 지원하며, 일시적인 오류나 오래된 캐시는 실제 크롤러 동작을 완전히 증명하지 못합니다.

자주 묻는 질문

robots.txt가 페이지의 색인을 막나요?

아니요. Disallow는 크롤링을 차단할 뿐 색인 생성을 막지는 않습니다. 다른 페이지가 허용되지 않은 URL로 연결되면 Google은 해당 URL을 여전히 색인할 수 있으며, 보통 검색 결과 설명은 표시되지 않습니다. 페이지를 색인에서 제외하려면 크롤링을 허용하고 noindex 메타 태그나 X-Robots-Tag 헤더를 추가하세요. 동시에 Disallow를 설정하면 Google이 noindex를 볼 수 없으므로 함께 사용해서는 안 됩니다.

robots.txt에서 규칙의 순서가 중요한가요?

Google에는 중요하지 않습니다. Google은 파일에서의 위치와 관계없이 가장 구체적인 규칙, 즉 일치하는 경로가 가장 긴 규칙을 적용하므로 Allow가 앞선 Disallow보다 우선할 수 있습니다. 이 도구도 같은 방식으로 일치 여부를 판단합니다. 일부 다른 크롤러는 처음 일치한 규칙을 따르므로 규칙을 명확하게 작성하세요.

Disallow와 noindex의 차이는 무엇인가요?

robots.txt의 Disallow는 크롤러에게 URL을 가져오지 말라고 지시합니다. 페이지의 메타 태그 또는 HTTP 헤더인 noindex는 해당 URL을 색인에 보관하지 말라고 지시합니다. 두 지시문은 서로 다른 문제를 해결하며 함께 사용하면 역효과가 납니다. 차단된 페이지는 가져오지 않으므로 noindex도 확인되지 않습니다.

robots.txt에서 CSS나 JavaScript를 차단하면 SEO에 악영향이 있나요?

그럴 수 있습니다. Google은 페이지를 이해하기 위해 렌더링하므로 페이지에 필요한 CSS와 JS를 가져올 수 없으면 레이아웃, 콘텐츠 또는 모바일 친화성을 잘못 판단할 수 있습니다. 페이지 렌더링에 필요한 리소스는 허용하고 실제로 불필요한 경로만 차단하세요.

robots.txt로 AI 크롤러를 차단하려면 어떻게 하나요?

차단하려는 각 AI 봇에 대해 사용자 에이전트 그룹을 만들고 루트 경로 전체의 크롤링을 허용하지 않는 규칙을 추가하세요. AI 크롤러 진단 버튼으로 목록을 불러와 규칙이 일치하는지 확인할 수 있습니다. robots.txt 준수는 자발적이라는 점에 유의하세요. 평판이 좋은 봇은 이를 따르지만 접근 제어 수단은 아닙니다.

다음 단계robots.txt 생성기 — generate a replacement robots.txt with the directives you meant to ship. 안내는 영어로 제공됩니다.