El primer mapa del sitio que escribí a mano tenía un error que me llevó una semana notar. Una de mis URL tenía una cadena de consulta con un signo comercial, algo así como ?id=1&sort=name- y lo había pegado directamente en un <loc> Etiqueta Google Search Console marcó todo el mapa del sitio como no válido, pero el mensaje de error era lo suficientemente vago como para que asumiera que el problema estaba en otro lugar. no lo fue Un ampersand crudo es ilegal en XML; tiene que ser escrito como &. Un personaje rompió todo el archivo, y cada página en él no se envió mientras buscaba un problema que no entendía.
Esa experiencia dio forma a mi forma de pensar sobre los mapas del sitio y, finalmente, sobre por qué agregué un Generador de mapas del sitio XML para Toolz.dev. Un mapa del sitio no es conceptualmente difícil (es una lista de URL envueltas en etiquetas), pero el formato es implacable y las partes que hacen tropezar a las personas son exactamente las partes que una máquina debe manejar: escapar de caracteres reservados, validar que cada URL es absoluta, atrapar duplicados y permanecer bajo los límites de tamaño de protocolo '. Entre ejecutar el SEO para mis propios proyectos y crear el complemento de WordPress wp administrar, he generado más mapas de sitio de los que puedo contar, y el mismo puñado de errores se repiten cada vez. Esta guía recorre qué es realmente un mapa del sitio, qué pertenece en él y cómo el generador elimina los bordes afilados.
TL;Dr: Un mapa del sitio XML es una lista de las URL importantes de su sitio en el formato de sitemaps.org, para que los motores de búsqueda puedan rastrearlos de manera eficiente. todo
<url>necesita un<loc>y puede llevar opcional<lastmod>,<changefreq>y<priority>Etiquetas Un solo archivo tiene un tope de 50.000 URL y 50 MB. los Generador de mapas del sitio XML toma una lista simple de URL, las escapa correctamente, elimina duplicados, advierte en los límites y produce un mapa del sitio válido.xml que puede descargar y enviar, todo en su navegador.
¿Qué es un mapa del sitio XML y necesito uno?
Un mapa del sitio XML es un archivo que enumera las URL de su sitio que desea que los motores de búsqueda conozcan. Sigue un pequeño estándar bien definido publicado en sitemaps.org y es compatible con Google, Bing y cualquier otro motor importante. El archivo envuelve cada URL en un <url> elemento dentro de un solo <urlset>, y declara un espacio de nombres para que los analizadores sepan qué versión del protocolo habla.
El mapa del sitio válido mínimo se ve así:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/</loc>
</url>
</urlset>
Esa es toda la forma. Todo lo demás (fechas, frecuencias, prioridades) es una decoración opcional encima del único elemento requerido <loc>.
¿Necesitas uno? Los motores de búsqueda encuentran páginas principalmente mediante los siguientes enlaces, por lo que un sitio pequeño y bien vinculado a menudo se descubre bien sin un mapa del sitio. Pero un mapa del sitio se gana la vida en varias situaciones comunes: un sitio grande donde los rastreadores pueden no llegar a todas las páginas en un número razonable de saltos; un sitio nuevo con pocos enlaces externos apuntando hacia él; un sitio con páginas que no están bien conectadas internamente, como contenido de archivo profundo; o un sitio que cambia con frecuencia y quiere señalar frescura. Un mapa del sitio no garantiza la indexación (es una invitación, no un comando), pero hace que sus URL importantes sean fáciles de encontrar y le brinda un canal limpio para informarle a Google sobre páginas que de otro modo podría pasar por alto.
¿Qué información va en cada entrada de URL?
Más allá de lo requerido <loc>, el protocolo define tres etiquetas secundarias opcionales, y hay mucho folclore sobre cuánto importan. Aquí está la versión honesta.
<loc> es la URL de la página. Debe ser absoluto, empezando por http:// investigaciones operacionales https://- totalmente calificado y con escape XML. Esta es la etiqueta en la que vivía mi antiguo error de signo comercial, y el generador escapa automáticamente de los cinco caracteres especiales XML para que nunca lo golpees.
<lastmod> es la fecha en que se cambió la página por última vez, en formato de fecha y hora de W3C: ya sea una simple 2026-07-25 o una marca de tiempo completa como 2026-07-25T14:30:00+00:00. Este realmente importa. Google ha dicho que usa lastmod Como una señal de cuándo volver a rastrear una página, siempre que el valor sea preciso y consistente. Si sella cada página con la fecha de hoy en cada compilación, le miente al rastreador y aprenderá a ignorarlo. Utilice una fecha de modificación real.
<changefreq> insinúa con qué frecuencia cambia la página - always, hourly, daily, weekly, monthly, yearly, o never. Google ha dejado claro que ignora en gran medida esta etiqueta, tratándola como una pista débil en el mejor de los casos. No hace daño incluirlo, pero no agonices sobre él.
<priority> es un número de 0.0 a 1.0 que sugiere la importancia de una página en relación con Otras páginas en su propio sitio. No afecta su clasificación contra otros sitios, y Google también lo ignora. El error común es establecer cada página en 1.0, lo que hace que la etiqueta no tenga sentido. Si lo usa, reserve los valores altos para sus páginas genuinamente más importantes.
El generador le permite aplicar changefreq, priorityy lastmod globalmente a cada URL y omite limpiamente cualquier etiqueta que deje en blanco, por lo que si desea un mapa del sitio simple de solo <loc> Las entradas, que es una opción perfectamente válida y cada vez más popular, obtienes exactamente eso.
¿Cómo creo un archivo sitemap.xml?
El flujo de trabajo está diseñado para ser rápido y para eliminar los errores de formato que plagan los mapas de sitio escritos a mano.
Comience por pegar sus URL en la entrada, una por línea. Puede pegar una lista exportada desde su CMS, un rastreo o una columna de hoja de cálculo. Las líneas en blanco se ignoran y cualquier línea que comience con # Se trata como un comentario, por lo que puede anotar o desactivar temporalmente las URL sin eliminarlas. Cada línea se ejecuta a través del analizador de URL WhatWG: si no es un válido, absoluto http investigaciones operacionales https URL, se omite y se informa, por lo que una ruta relativa desviada o un error tipográfico nunca corrompe silenciosamente la salida.
A continuación, establezca los valores predeterminados. Elija una frecuencia de cambio en el menú desplegable, establezca una prioridad si la desea y active la última fecha modificada; el valor predeterminado es hoy, pero puede elegir cualquier fecha. Luego decida sobre la limpieza: habilite la deduplicación para eliminar URL repetidas (activada de forma predeterminada, porque está duplicada) <loc> Las entradas son un artefacto común de copiar y pegar), y, opcionalmente, ordenar la lista alfabéticamente, de modo que sea más fácil escanear y diferenciar con una versión anterior.
Las actualizaciones de salida en vivo mientras cambias cualquier cosa. Cuando se vea bien, copie el XML o descárguelo directamente como sitemap.xml. La herramienta también informa cuántas URL entró, el tamaño del archivo y las líneas que omitió y por qué, para que obtenga una cuenta clara de exactamente lo que entró en el archivo, no solo una masa de XML en la que debe confiar.
¿Dónde pongo el mapa del sitio y cómo lo envío?
Generar el archivo es la mitad del trabajo; la otra mitad está haciendo que los motores de búsqueda lo conozcan.
primero, Cargue Sitemap.xml a la raíz de su sitio Por lo tanto, es accesible en https://yoursite.com/sitemap.xml. La ubicación es más importante de lo que la gente espera: un mapa del sitio solo puede contener URL desde el mismo nivel de directorio o por debajo de donde está, por lo que colocarlo en la raíz le permite cubrir todo el sitio. La mayoría de los hosts y las plataformas CMS le permiten colocar un archivo estático en la raíz web, o puede servirlo desde una ruta.
segundo, Envíe la URL del mapa del sitio en Google Search Console En Indexing → Sitemaps y en Bing Webmaster Tools bajo la sección Equivalente. Pega la URL completa y el motor la recupera, informa cuántas URL lee y marca los errores. Aquí también verá si Google indexó realmente las páginas, que es independiente de si leyó el mapa del sitio.
En tercer lugar, y este es el paso que la mayoría de la gente se salta Agrega una referencia en tu robots.txt. una sola línea, Sitemap: https://yoursite.com/sitemap.xml, permite que cualquier rastreador descubra su mapa del sitio automáticamente sin que lo envíe a ninguna parte. Es el movimiento de la correa y los brazales, y se combina naturalmente con el Generador de robots.txt en el sitio, que puede producir ese archivo con la línea del mapa del sitio ya en su lugar. Las dos herramientas están diseñadas para usarse juntas: robots.txt les dice a los rastreadores a qué pueden acceder y el mapa del sitio les dice qué existe.
¿Cuáles son los límites de tamaño y qué sucede cuando los supero?
El protocolo de Sitemaps.org limita un solo archivo de mapa del sitio en 50.000 URL y 50 MB sin comprimir. Estos son límites estrictos (un archivo que infringe cualquiera de los dos se rechaza) y existen para que los analizadores no tengan que cargar archivos ilimitados en la memoria.
Para la mayoría de los sitios, esto no es un problema; se quedará sin páginas mucho antes de que se quede sin espacio. Pero los grandes catálogos de comercio electrónico, archivos de noticias y sitios de contenido generado por usuarios superan las 50.000 URL de forma rutinaria. Cuando eso sucede, la respuesta es una Índice de mapa del sitio: Divide sus URL en varios archivos de mapa del sitio (cada uno por debajo del límite) y crea un archivo de índice que los enumera. El índice utiliza un <sitemapindex> envoltura en lugar de <urlset>, y los motores de búsqueda obtienen primero el índice, luego cada mapa del sitio secundario.
El generador cuenta sus URL y el tamaño de bytes de la salida a medida que construye, y le advierte en el momento en que se cruza cualquiera de los límites, con una nota en lenguaje sencillo que le indica que se divida en varios archivos detrás de un índice. Esa alerta temprana es deliberada: el peor momento para descubrir que ha superado el límite es después de haber enviado un archivo que Search Console luego rechaza. Conocer su recuento sobre la marcha convierte un fracaso en una decisión de planificación.
Una comparación: qué pertenece a su mapa del sitio y qué no
Un mapa del sitio es una declaración de intenciones - " Estas son las páginas canónicas que quiero indexar" - entonces lo que omites es tan importante como lo que pones. Rellenarlo con basura envía señales contradictorias y puede diluir cuánto confía Google en él.
| incluir | exceptuar |
|---|---|
| Páginas canónicas e indexables que desea clasificar | URL duplicadas o no canónicas |
| Contenido importante y páginas de categorías | Páginas bloqueadas por robots.txt o Noindex |
| páginas nuevas que desea volver a rastrear | Redirige (3xx) y páginas de error (4xx/5xx) |
| Páginas débilmente vinculadas internamente | URL con parámetros de seguimiento o ID de sesión |
El principio rector es que cada URL en su mapa del sitio debe devolver un estado de 200, ser canónica y ser una página que le encantaría ver en los resultados de búsqueda. Enumerar una URL no obliga a Google a indexarla, y enumerar páginas que le ha dicho a Google que ignore en otros lugares (a través de una etiqueta sin índice o un bloque robots.txt) es contradictorio. Un mapa del sitio enfocado de sus mejores páginas supera consistentemente un volcado exhaustivo de todo lo que el rastreador teóricamente podría alcanzar.
¿Dónde encaja un generador de mapa del sitio en un kit de herramientas SEO?
Construyo Toolz.dev como un conjunto de utilidades conectado en lugar de una pila de dispositivos no relacionados, y las herramientas técnico-SEO están diseñadas para funcionar en grupo. El generador de mapa del sitio se empareja más directamente con el Generador de robots.txt- los dos archivos son el protocolo de enlace estándar entre su sitio y un rastreador, uno dice a qué se puede acceder y el otro enumera lo que existe. En el nivel de página, el Generador de metaetique Produce el título, la descripción y las etiquetas de gráficos abiertos que determinan cómo aparece cada una de esas URL de mapa del sitio en los resultados de búsqueda y en las redes sociales. Y cuando esté construyendo las URL en sí, el generador de babosas Convierte los títulos de las páginas en los caminos limpios y legibles que son un buen mapa del sitio en primer lugar.
El hilo que los conecta es que cada uno hace un trabajo de forma precisa y local, sin cargar sus datos. Ese último punto no es incidental para una herramienta de mapa del sitio: su lista de URL es efectivamente un mapa de toda la estructura de su sitio, incluidas las páginas que quizás aún no haya iniciado, y no debe enviarse a un servidor de terceros solo para envolverlo en etiquetas. Aquí todo se ejecuta en su navegador, lo que hace que sea seguro usarlo en sitios de preparación y trabajo de clientes bajo NDA, una postura de privacidad sobre la que escribí extensamente en la guía Mantener sus datos privados con herramientas del lado del cliente. Es la misma filosofía de construcción que traigo a todas las utilidades del sitio, que desempaqué en el Guía del kit de herramientas para desarrolladores web: Las herramientas pequeñas, nítidas y honestas superan a las plataformas todo en uno hinchadas que quieren que sus datos sean el precio de la admisión.
Errores comunes al crear un mapa del sitio
Los errores recurrentes valen la pena nombrarlos para que puedas evitarlos. primero, Caracteres especiales sin escapar- el error de signo comercial con el que abrí. Crudo &, <y > Los caracteres de una URL rompen el XML. El generador escapa de los cinco caracteres reservados automáticamente, pero si después editas el archivo a mano, tenlo en cuenta.
segundo, URL relativas o relativas al protocolo. un <loc> Debe ser absoluto e incluir el esquema. /about investigaciones operacionales //example.com/about ambos son inválidos; solo https://example.com/about Obras. La herramienta rechaza y reporta cualquier cosa que no sea una URL absoluta adecuada en lugar de pasarla.
tercero, Incluyendo URL no canónicas o no indexables- redirecciona, no incluye páginas o duplica con parámetros de seguimiento. Estos envían señales contradictorias y presupuesto de rastreo de residuos. Mantenga el mapa del sitio en páginas canónicas de 200 estados.
cuarto, rancio o deshonesto lastmod fechas. Estampar cada página con la fecha actual en cada implementación enseña a Google a desconfiar por completo de la etiqueta. Use fechas de modificación reales, o deje lastmod apagado en lugar de fingir.
quinto, Olvidar volver a enviar o hacer referencia al mapa del sitio. Generar el archivo no hace nada por sí solo: debe cargarlo, enviarlo a Search Console e idealmente señalarlo desde robots.txt. Un mapa del sitio ubicado en su servidor del que no se le ha hablado a ningún rastreador es solo un archivo.
Preguntas frecuentes
¿Qué es un mapa del sitio XML?
Un mapa del sitio XML es un archivo que enumera las URL importantes de su sitio para que los motores de búsqueda puedan encontrarlas y rastrearlas de manera eficiente. Sigue el protocolo Sitemaps.org, envolviendo cada URL en un <url> Elemento con una fecha de última modificación opcional, frecuencia de cambio y prioridad. El envío de uno ayuda a los motores de búsqueda a descubrir páginas que no están bien vinculadas internamente.
¿Cómo creo un archivo sitemap.xml?
Pegue las URL de su sitio en este generador, una por línea, establezca la frecuencia y la prioridad de cambio que desee, luego copie o descargue el resultado como sitemap.xml. Cargue ese archivo al directorio raíz de su sitio web para que viva en https://susite.com/mapa de sitio.xmly envíe su URL en Google Search Console. Todo el proceso toma un par de minutos.
¿Qué hacen realmente ChangeFreq y Priority?
changefreq sugiere con qué frecuencia cambia una página y la prioridad (0.0 a 1.0) sugiere su importancia en relación con otras páginas de su sitio. Ambas son sugerencias, no comandos; Google ha dicho que las ignora en gran medida y se basa en sus propias señales. No hacen daño, así que configure changefreq de forma aproximada y reserve la prioridad 1.0 para sus páginas más importantes.
¿Cuántas URL puede contener un mapa del sitio?
Un solo archivo de mapa del sitio está limitado a 50 000 URL y 50 MB sin comprimir. Si su sitio es más grande, divida las URL en varios archivos de mapa del sitio y enumere esos archivos en un índice de mapa del sitio. Esta herramienta le advierte tan pronto como se cruza cualquiera de los límites para que sepa cuándo descomponer el archivo.
¿En qué formato debe estar la fecha de LastMod?
Use formato de fecha y hora de W3C: ya sea una fecha simple como 2026-07-25 o una marca de tiempo completa como 2026-07-25T14:30:00+00:00. Este generador acepta ambos y está predeterminado en la fecha de hoy en la que habilitas LastMod sin ingresar uno. Los valores de LastMod precisos ayudan a los motores de búsqueda a priorizar las páginas de rerastreo que han cambiado genuinamente.
¿Necesito incluir todas las páginas de mi mapa del sitio?
Incluya las páginas canónicas e indexables que desea clasificar y omita duplicados, redireccionamientos, páginas de error y cualquier cosa bloqueada por robots.txt o una etiqueta noindex. La lista de una URL no garantiza la indexación y el relleno del archivo con URL de bajo valor envía señales mixtas. Un mapa del sitio enfocado de sus mejores páginas funciona mejor que uno exhaustivo.
¿Dónde envío mi mapa del sitio después de generarlo?
Cargue Sitemap.xml a la raíz de su sitio, luego envíe su URL completa en Google Search Console en Indexing → Sitemaps y en Bing Webmaster Tools. También puede agregar un "mapa del sitio": https://susite.com/mapa de sitio.xml"Línea a tu archivo robots.txt para que cualquier rastreador pueda descubrirlo automáticamente.
¿Mi lista de URL se mantiene privada?
Sí. Todo el mapa del sitio está integrado en su navegador con JavaScript simple. Sus URL, que pueden exponer toda la estructura de su sitio, nunca se transmiten, registran ni almacenan, y la herramienta sigue funcionando sin conexión de red una vez que la página se ha cargado.



