로그 파일 분석기
Free, no signup. Server logs answer a question your analytics can't: what are crawlers actually doing on your site. Drop one in and see crawl budget by bot and by section, how much is wasted on 404s and redirects, how AI crawlers compare to search engines, and which requests are impostors faking a crawler user-agent.
Handles nginx / Apache (combined & common), IIS / W3C Extended, and JSON logs (incl. Cloudflare Logpush) — format auto-detected. Crawler ranges updated 24 days ago.
전체 과정이 브라우저에서 실행되며, 붙여넣은 내용은 업로드되거나 저장되지 않습니다. Spot-checking a suspicious IP against the Googlebot Verifier sends only that IP to our server. 익명 실행별 결과 계수는 종합 연구에 사용될 수 있습니다. URL, 도메인, IP 및 식별자는 절대 포함되지 않으며 100회 미만의 실행에 대한 통계는 공개하지 않습니다.
Who's crawling you
Requests grouped by crawler type. AI crawlers and search engines want different things from your site. "Other / unclassified" is everything with no known crawler user-agent — human browsers and untracked tools.
Crawl over time
Daily crawl requests by crawler type across the log's date range.
Crawl budget by bot
Each crawler seen in the log: how many requests, how it was verified, and how much of its crawl hit redirects or errors (excluding 304 revalidation).
Spoofer report
Requests that sent a crawler's user-agent from an IP outside that operator's published ranges — likely impostors. robots.txt won't stop these (impostors ignore it); block by IP or ASN. Spot-check any IP for the real network owner via forward-confirmed reverse DNS — this is the one action that leaves your browser (a single lookup to our verifier API).
Crawler × page-type matrix
Where each recognized crawler concentrates requests across inferred page cohorts. Cell intensity represents request count; the label also shows wasted requests.
Crawl budget by section
Where crawlers spend their time on your site (bot traffic only). High waste in a section means crawlers are burning budget on broken or redirecting URLs there.
Most-wasted URLs
Individual URLs where crawlers hit redirects or errors most often (excluding 304 revalidation) — the highest-leverage fixes for crawl budget.
AI-invented URL candidates
Observed 404/410 requests with an AI crawler or known AI-assistant referrer. This is the primary evidence mode: a row is a candidate, not proof that a model invented it — it may be a deleted or migrated URL. Suggested destinations compare only against the sitemap/URL list you supplied above.
Optional URL probe simulation
Ask the site’s open-model simulator for plausible paths, then check their live status. This is explicitly a simulation, never observed assistant output; log evidence above is stronger.
Expected URLs vs crawler requests
Recommendations
이 도구 평가하기
이 도구 정보
서버 액세스 로그는 사이트에서 크롤러가 실제로 어떻게 동작하는지 보여 줍니다. 어떤 URL을 요청하고 어떤 상태 코드를 받으며 크롤링 예산을 어디에서 낭비하는지 확인할 수 있습니다. 이 도구는 기존 검색 크롤러(예: Googlebot), AI 검색 및 학습 크롤러를 구분하고 IP 및 DNS 증거로 의심스러운 사용자 에이전트를 표시합니다.
nginx, Apache, IIS/W3C 및 JSON(Cloudflare Logpush 포함) 형식을 브라우저에서 로컬로 분석하며 아무것도 업로드하지 않습니다. 결과는 크롤링 동작을 설명할 뿐 색인 생성을 설명하지는 않습니다.
기능
- 확인됨, 사칭됨, 검증 불가 요청 수와 상태 분포 및 낭비 비율을 포함한 봇별 크롤링 예산.
- 섹션별 검색, AI 검색 및 학습 봇 분석과 시간에 따른 일일 추세.
- 의심스러운 IP에 대한 역방향 DNS 및 ASN 확인을 포함한 사칭 보고서.
- 복사해 사용할 수 있는 robots.txt Disallow 줄과 봇 및 낭비 URL의 CSV 내보내기를 포함한 우선순위 추천.
작동 방식
업로드 영역에 하나 이상의 로그 파일을 끌어놓거나 예시 데이터를 사용합니다. 형식을 자동으로 감지하고 큰 파일은 조각 단위로 스트리밍하며 각 줄에 봇, IP, 상태 및 경로 속성을 부여합니다. 그런 다음 분석기가 예산, 낭비 및 추세를 계산하고 의심스러운 IP를 실시간으로 확인해 구체적인 수정 사항을 우선순위별로 정렬합니다.
제한사항
- 이 도구는 서버가 기록한 요청만 볼 수 있으므로 크롤러가 URL을 선택한 이유나 색인 생성 여부를 설명할 수 없습니다.
- 공개 IP 범위가 없는 크롤러는 진짜 또는 가짜로 분류하지 않고 검증 불가로 남깁니다.
- 섹션은 URL 경로에서 추론되므로 로그를 보여 주는 관점일 뿐 사이트 상태에 대한 완전한 보고서는 아닙니다.
자주 묻는 질문
내 로그 파일이 업로드되나요?
아니요. 파싱과 분석은 브라우저의 Web Worker에서 전부 실행됩니다. 파일은 디스크에서 조각 단위로 읽어 로컬에서 처리하며 서버로 전송하지 않습니다. 유일한 예외는 사칭자 보고서의 선택적 IP 점검으로, 로그가 아닌 IP 주소 하나를 검증 API에 보내 순방향 확인 역방향 DNS 및 ASN 조회를 수행합니다. 탭을 닫으면 분석된 데이터가 모두 사라집니다.
어떤 로그 형식을 지원하나요?
형식을 자동으로 감지합니다. nginx와 Apache combined 및 common 형식, IIS / W3C Extended, Cloudflare Logpush를 포함한 JSON 로그를 읽습니다. 여러 파일을 한 번에 넣을 수 있으며 큰 로그는 조각 단위로 스트리밍하므로 수 기가바이트의 액세스 로그도 탭을 멈추게 하지 않습니다.
실제 크롤러와 위조 크롤러를 어떻게 구분하나요?
각 요청을 사용자 에이전트로 알려진 크롤러와 연결한 뒤 출처 IP를 운영자가 공개한 IP 범위와 대조하며, Googlebot Verifier와 같은 주간 갱신 목록을 사용합니다. Google 범위 밖의 IP에서 Googlebot 사용자 에이전트를 보내면 사칭 가능성이 높다고 표시합니다. ByteDance의 Bytespider처럼 범위를 공개하지 않는 운영자는 해당 요청을 사칭이 아니라 검증 불가로 표시합니다.
낭비된 크롤링 예산의 기준은 무엇인가요?
유용한 `304 Not Modified` 재검증을 제외하고 리디렉션을 받거나, 404 또는 410 같은 4xx 오류를 받거나, 5xx 서버 오류를 받은 크롤러 요청입니다. 도구는 봇, 섹션 및 개별 URL별로 낭비를 합산해 영향이 큰 수정 지점을 보여 줍니다.
robots.txt로 위조 크롤러를 차단할 수 있나요?
아니요. 사칭자는 robots.txt를 무시하려고 크롤러 사용자 에이전트를 보내므로 Disallow 줄은 효과가 없습니다. 에지 또는 방화벽에서 IP나 ASN으로 차단하세요. robots.txt는 원하지 않는 섹션에서 예산을 낭비하는 진짜 크롤러에 적합하며 추천 패널이 복사해 사용할 수 있는 Disallow 줄을 생성합니다.
자주 발생하는 문제와 해결 방법
- 경고 크롤러 주장이 운영자의 공개 범위를 벗어납니다 해결 방법: IP가 운영자의 공개 범위와 일치할 때까지 크롤러를 미검증으로 취급하고 차단하거나 조사하세요.
- 경고 크롤러가 유용하지 않은 URL에 요청을 소비합니다 해결 방법: 가치 낮은 매개변수, 필터, 검색, 중복 URL을 차단하거나 정규화하고 우선순위 URL로 향하는 링크를 강화하세요.
- 경고 크롤러가 반복해서 오류 응답을 받습니다 해결 방법: 4xx/5xx를 반환하는 요청 빈도 높은 크롤러 URL을 복구하거나 리디렉션하고 계속 제거할 URL의 내부 링크를 없애세요.
- 검토 필요 크롤러가 과도한 리디렉션을 만납니다 해결 방법: 내부 링크와 사이트맵 항목이 최종 URL을 직접 가리키게 하고 리디렉션 체인을 한 단계로 줄이세요.
- 검토 필요 크롤러가 예상 URL 집합 밖의 URL을 방문합니다 해결 방법: 크롤러가 발견한 URL을 정규 내부 링크 및 사이트맵 집합에 추가하거나 의도하지 않은 URL이면 리디렉션하거나 제거하세요.
- 검토 필요 예상 중요 URL에 크롤러 방문이 없습니다 해결 방법: 예상 URL에 크롤링 가능한 내부 링크와 정규 사이트맵 항목을 추가한 뒤 robots 및 인증 장벽을 확인하세요.
- 경고 크롤러 활동이 크게 감소합니다 해결 방법: 감소일을 robots, 상태, 사이트맵, 배포, 서버 용량 변경과 비교한 뒤 영향받은 크롤 경로를 복원하세요.
- 검토 필요 크롤러 활동이 크게 급증합니다 해결 방법: 급증을 일으킨 URL 패턴을 식별하고 새로 노출된 매개변수, 함정, 리디렉션 또는 중복 크롤 경로를 억제하세요.
- 검토 필요 크롤러 응답 시간이 느립니다 해결 방법: 새 크롤링을 요청하기 전에 가장 느린 크롤러 엔드포인트를 캐시하거나 최적화하고 원본 지연을 줄이세요.