Generador de sitemaps XML

Bounded and polite: at most three page requests run at once; each request is capped at 900 KB/10 seconds, and the server also rate-limits each target host. This is a sitemap seed, not a full-site crawler.

Las comprobaciones se ejecutan desde nuestro servidor; consultamos la URL que introduces y no conservamos los resultados. The start site, its robots.txt, and eligible same-host HTML pages are sent through this site's bounded fetch endpoints. Crawl decisions and XML generation run in your browser. Los contadores anónimos de resultados por ejecución pueden utilizarse para investigación agregada; nunca incluyen URL, dominios, IP ni identificadores, y no se publica ninguna estadística con menos de 100 ejecuciones.

Comentarios
Informar de un error

¿Algo no funciona en Generador de sitemaps XML? Cuéntanos qué ha ocurrido. El informe va directamente a una cola privada de revisión, no a una lista pública.

Datos que se enviarán
 No se adjuntan automáticamente entradas de la herramienta, archivos subidos, fuentes pegadas, resultados completos, parámetros de consulta ni fragmentos de URL. Puedes editar o eliminar arriba el pasaje seleccionado. Los metadatos del navegador y de protección contra abusos se procesan para prevenir spam. 

Acerca de esta herramienta

Gratis y sin registro. Rastrea un conjunto limitado de páginas del mismo sitio, respeta robots.txt, excluye URL con noindex o canonical externo y descarga un sitemap XML que distingue claramente lo incluido, excluido y desconocido.

Funciones

  • Permite elegir un máximo de 25, 50, 100 o 200 páginas y avisa si la cola sigue pendiente al alcanzar ese límite.
  • Respeta las reglas de Googlebot en robots.txt y excluye páginas con noindex o canonical que apunta a otra URL.
  • Mantiene como desconocidas las respuestas fallidas, no HTML, truncadas o distintas de 2xx en vez de incluirlas silenciosamente.
  • Solo emite lastmod cuando encuentra un HTTP Last-Modified válido, un time datetime visible o dateModified/datePublished en JSON-LD.

Cómo funciona

Desde la Start URL, el rastreador sigue enlaces del mismo sitio hasta el máximo seleccionado, consulta robots.txt y evalúa estado HTTP, tipo de contenido, noindex y canonical. Las páginas aptas se convierten en entradas XML; las excluidas y desconocidas se informan aparte, y lastmod solo se añade a partir de evidencia de fecha válida.

Limitaciones

  • Es una semilla limitada, no un rastreador completo: ejecuta como máximo tres solicitudes simultáneas, limita cada respuesta a 900 KB/10 segundos y aplica límites por host.
  • No asigna la fecha actual a todas las páginas y no puede confirmar URL que no descubre dentro del máximo elegido o que quedan en estado desconocido.

Preguntas frecuentes

¿Rastreará todo mi sitio?

No. Eliges un límite estricto de hasta 200 páginas. La herramienta indica si la cola sigue ocupada al alcanzarlo, de modo que nunca presenta un rastreo limitado como completo.

¿Qué páginas se excluyen?

Se excluyen las que tienen noindex en cabecera o meta, un canonical hacia otra URL o están bloqueadas para el robot de Google en robots.txt. Los fallos, respuestas no HTML, truncadas o fuera de 2xx permanecen en un estado desconocido separado.

¿Cómo se elige lastmod?

Solo se emite una cabecera HTTP Last-Modified válida, un atributo datetime mostrado o un valor JSON-LD dateModified/datePublished. La herramienta nunca asigna la fecha actual a todas las páginas.

Siguiente pasoValidador de sitemaps XML — verify it with a direct check. La orientación está disponible en inglés.