Command Palette

Search for a command to run...

Generador de robots.txt: cree, valide y pruebe las reglas de rastreo sin desindexar su sitio

Generador de robots.txt: cree, valide y pruebe las reglas de rastreo sin desindexar su sitio

T
Toolz Team
|Jul 19, 2026|21 Min Lectura

Parte de la colección Herramientas SEO

Los cuatro personajes más caros que he visto enviados fueron Disallow: /. Un equipo empujó un robots.txt a la producción durante un lanzamiento, nadie se dio cuenta, y durante los diez días siguientes, Google dejó caer silenciosamente la mayoría de las páginas del sitio. El tráfico no se desplomó de una manera que activaba las alarmas; se agotó. Para cuando alguien pensó en comprobar /robots.txt, la recuperación fue un mes de re-rastreo. El archivo que lo causó tenía cuatro líneas de largo.

Robots.txt es engañosamente simple. Es texto sin formato, tiene quizás seis directivas que vale la pena conocer y la sintaxis encaja en una ficha. Esa simplicidad es exactamente la razón por la que sale mal: no hay ningún paso de compilación, ni linter en su CI, ni sistema de tipos, ni mensaje de error. Si escribe una regla que un rastreador no puede analizar, el rastreador ignora silenciosamente esa línea y continúa. Su archivo se ve bien, su sitio se ve bien y algo que pensó que estaba bloqueado se está rastreando, o algo que necesitaba rastrear no.

yo construyo Toolz.dev Y escribo archivos robots.txt para entornos de puesta en escena, sitios de clientes y mis propios proyectos constantemente, así que construí el Generador de robots.txt para que los modos de falla sean visibles. Construye el archivo a partir de un formulario estructurado, por lo que la sintaxis está en la parte correcta de la construcción. Pelusa lo que has escrito y llama a las pistolas con números de línea. Y prueba una URL con sus reglas usando el mismo uso de los rastreadores reales de precedencia de mayor mayor, por lo que puede demostrar que una página es accesible antes de implementarla en lugar de después de que Search Console le dice que no lo es.

TL;Dr: Robots.txt les dice a los rastreadores qué pueden recuperar. No elimina páginas de los resultados de búsqueda y no protege nada privado: el archivo es público y el cumplimiento es voluntario. Las reglas solo se aplican dentro de a User-agent: grupo, las rutas deben comenzar con /, * coincide con cualquier cosa, un final $ Ancla el final, y cuando coinciden dos reglas, el patrón más largo gana con permitir lazos de ruptura. los Generador de robots.txt Construye, pelusa y prueba todo eso en su navegador.

Lo que realmente controla Robots.txt

Robots.txt es una directiva de rastreo, no una directiva de índice. Esa única distinción explica la mayor parte de la confusión que la rodea.

Cuando un rastreador quiere buscar una URL en su host, primero se recupera https://yourhost/robots.txt y verifica si la URL está permitida. Si un Disallow Coincidencias de reglas, un rastreador que se porta bien no solicita la página. Ese es todo el mecanismo. Gobierna la solicitud HTTP, y nada más.

Lo que no hace es eliminar una URL del índice de búsqueda. Google puede indexar URLs que nunca ha obtenido, utilizando solo el texto de anclaje y el contexto de los enlaces que los apuntan. si bloqueas /pricing En Robots.txt y Cincuenta sitios Enlace a /pricing, Google aún puede mostrar esa URL en los resultados, generalmente sin descripción, porque nunca lee la página. Bloquear una URL que desea dejar de buscar funciona activamente en su contra: el noindex Etiqueta que lo eliminaría vive dentro de la página, y un rastreador que no puede buscar la página nunca puede verla. La secuencia correcta es permitir el rastreo, servir <meta name="robots" content="noindex"> o un X-Robots-Tag: noindex Encabezado, espere a que se abandone la página y solo luego bloquéala si desea ahorrar presupuesto de rastreo.

Tampoco protege nada. Robots.txt se sirve públicamente en un camino conocido; cualquiera, incluyendo a todos los atacantes en Internet, puede leer el suyo en un navegador. un Disallow: /internal-admin-v2/ la línea es una señal que apunta a lo que querías ocultar. Los raspadores maliciosos ignoran el archivo por completo; respetarlo es una convención voluntaria, no un mecanismo de aplicación. Todo lo que debe ser privado necesita autenticación o una lista de permitidos de IP. Robots.txt es una solicitud, realizada cortésmente, a los rastreadores que eligen escuchar.

Características clave del generador robots.txt

Editor de grupos estructurados

La gramática del archivo es: uno o más User-agent: líneas seguidas de las reglas que se aplican a ellos. Escribir que a mano invita al error estructural más común, que es una regla que flota por encima de la primera User-agent: línea donde se aplica a nadie. El generador crea grupos como objetos de primera clase, por lo que cada regla que agregue necesariamente pertenece a un grupo.

Un validador que informa los footguns reales

El Linter se ejecuta en cada pulsación de tecla y reporta errores, advertencias y notas con números de línea. Marca reglas fuera de cualquier grupo, los caminos faltan su barra de ataque, una simple Disallow: Sin valor (que significa "permitir todo" y casi nunca es lo que el autor quiso decir), las URL de mapa del sitio que no son absolutas, $ se utiliza en cualquier lugar excepto al final de un patrón, directivas desconocidas, grupos duplicados de agentes de usuario y, en voz alta, a Disallow: / Sentado bajo User-agent: *.

Un probador de URL real

Ingrese una ruta y un agente de usuario y la herramienta informa Permitido o No permitido, además de la regla exacta que lo decidió. La lógica de precedencia es la real de RFC 9309: el patrón de ruta coincidente más largo gana independientemente de las reglas de orden que aparecen en el archivo, y si dos patrones tienen la misma longitud, Permitir tiempos No permitir. Esta es la parte en la que la gente se equivoca con mayor frecuencia por intuición, porque no se comporta como un firewall & #39; Las reglas de victorias en el primer partido.

Presets con un solo clic

Permita que todo, bloquee todo, WordPress, Shopify, Next.js y Bloquee los rastreadores de IA, cada uno llena todo el formulario con un punto de partida correcto y sensato. Los bloques preestablecidos de WordPress /wp-admin/ mientras la talla /wp-admin/admin-ajax.php, que muchos archivos escritos a mano olvidan y, por lo tanto, rompen la funcionalidad front-end que Google necesita para renderizar la página.

Controles de orugas de IA

Un clic agrega grupos de rechazo para GPTbot, Claudebot, PerplexityBot, CCbot, Google-Extended, Bytespider y Anthropic-AI, mientras que Googlebot y Bingbot son libres para rastrear. La tabla de rastreador conocido explica lo que realmente hace cada bot, por lo que está tomando una decisión informada en lugar de pegar una lista de una publicación de blog.

Analiza tu archivo existente

Pegue los robots.txt que ya sirve y la herramienta lo leerá nuevamente en grupos editables. La mayoría del trabajo de robots.txt no es totalmente nuevo: audita y repara algo escrito hace tres años por alguien que se fue, y comenzar con lo que realmente está en vivo es la única forma sensata de hacerlo.

Todo permanece en tu navegador

El archivo se genera, se enlaza y se prueba completamente en JavaScript del lado del cliente. No se carga nada, por lo que puede redactar reglas de forma segura para un host de puesta en escena o una sección no anunciada de un sitio, y la herramienta funciona sin conexión una vez cargada.

Cómo usar el generador robots.txt

Paso 1: Comience desde un preset o importe lo que ya tiene

Si está comenzando de nuevo, elija el preset más cercano a su pila. Si ya sirves a un robots.txt, recógelo de https://yoursite.com/robots.txt, péguelo en el cuadro de importación y haga clic en Analizar en grupos. La herramienta reconstruye la estructura de grupo y el validador le indica de inmediato qué es lo que está mal con el archivo que ha estado ejecutando en producción.

Paso 2: Cree sus grupos de agentes de usuarios

Cada grupo apunta a uno o más rastreadores. Agregue rastreadores de la lista de robots conocidos o escriba un token directamente; los tokens coinciden sin sentido, por lo que googlebot y Googlebot son equivalentes. un grupo con * Es el catch-todo: se aplica a cualquier rastreador que no tenga un grupo más específico propio.

Lo crítico que hay que internalizar aquí es que los rastreadores obedecen exactamente a un grupo. Googlebot lee el Googlebot grupo si existe e ignora el * agrupar completamente, no los fusiona. Si creas un Googlebot grupo Para agregar una regla, debe repetir cada regla desde el * Agrupa dentro de él, o Googlebot dejará de obedecerlos en silencio. Esto sorprende a casi todos la primera vez.

Paso 3: Agregar reglas, mapas de sitio y leer el validador

Agregue rutas que no permitan lo que desea que los rastreadores omitan y permita rutas para las separaciones dentro de ellos. Agregue un retardo de rastreo solo si está apuntando a un motor que respete uno. Agregue las URL de su mapa del sitio; estas deben ser absolutas, incluido el esquema y el host, y se ubican fuera de cualquier grupo, aplicándose a todos.

Luego lea el validador. Los errores son cosas que no funcionarán. Las advertencias son cosas que probablemente no significan lo que piensas. Las notas son oportunidades. Arregla todo rojo antes de ir más allá.

Paso 4: Prueba las URL que realmente te importan

Este es el paso que la gente omite y no debería hacerlo. Tome las tres o cuatro rutas cuyo estado de rastreo realmente importa: las páginas de su producto, su blog, la ruta de administración que cree que bloqueó, el archivo CSS que Google necesita para representar su diseño y pruebe cada una con Googlebot. La herramienta le indica Permitido o No permitido y nombra responsable la regla. Si un resultado le sorprende, sus reglas no dicen lo que cree que dicen, y es mucho más barato aprenderlo ahora.

Paso 5: Copiar o descargar y desplegar en la raíz

Copiar el archivo o descargar robots.txt, luego sírvelo exactamente https://yourhost/robots.txt con un 200 estado y un text/plain Tipo de contenido. En ningún otro lugar funciona. /blog/robots.txt no es leído por nadie.

El protocolo de exclusión de robots, en detalle

finalmente es un estándar

Durante veinticinco años robots.txt fue una convención descrita en una publicación de lista de correo de 1994, y cada uno de los rastreadores interpretaba las ambigüedades a su manera. En 2022 se publicó como RFC 9309, que codifica las reglas de análisis, la semántica de coincidencia y el orden de precedencia en el que habían convergido Google, Bing y los rastreadores más serios. Cuando esta guía dice &quot; la regla es X&quot; significa que RFC 9309 dice X, no que una publicación de blog lo afirme.

grupos, y por qué los rastreadores solo obedecen a uno

Un registro consta de uno o más User-agent: líneas seguidas de las reglas que se les aplican. Un rastreador se identifica con un token de producto - Googlebot, Bingbot, GPTBot- y busca el grupo cuya ficha coincida más específicamente. Obedece a ese grupo y a ningún otro. El * El grupo es el respaldo, que se usa solo cuando nada más específico coincide.

La consecuencia práctica vale la pena repetir porque causa tanto daño: los grupos no heredan. un archivo que lee

User-agent: *
Disallow: /admin/
Disallow: /cart

User-agent: Googlebot
Disallow: /internal/

significa que el robot de Google puede rastrear /admin/ y /cart libremente Encontró su propio grupo, por lo que el * grupo es invisible para él. Si desea que Googlebot esté bloqueado de los tres, las tres reglas deben aparecer dentro de la Googlebot grupo

Precedencia de partido más largo

Cuando dos o más reglas en el grupo correspondiente coinciden con una URL, el ganador es el que tiene el Patrón de camino más largo, medido en caracteres. El orden en el archivo es irrelevante. Si la coincidencia más larga y la no permitida de coincidencia más larga son la misma longitud, permita ganar.

User-agent: *
Disallow: /admin
Allow: /admin/public

Bajo estas reglas, /admin/public/logo.png es permitido- el patrón Allow es de 13 caracteres frente a Disallow&#39;s 6 - mientras /admin/secret es desautorizado, porque solo el patrón de no permitir coincide con él. Este es el mecanismo detrás de cada "bloquear el directorio, permitir un archivo dentro de su patrón", incluido WordPress. admin-ajax.php de corte. También es por eso que escribir reglas de arriba hacia abajo como una configuración de firewall produce intuiciones incorrectas: no hay ganancias en el primer partido, no hay caídas y ningún orden.

Comodines y el anclaje final

Se admiten dos caracteres especiales en patrones de ruta.

* Coincide con cualquier secuencia de caracteres, incluyendo ninguno. Disallow: /*?sessionid= Bloquea cualquier URL que contenga ese parámetro de consulta en cualquier lugar.

$ Ancla el final de la URL y solo significa que cuando es el carácter final del patrón. Disallow: /*.pdf$ bloques /whitepaper.pdf pero no /whitepaper.pdf?download=1, porque esa URL no termina en .pdf. suelta el $ y bloqueas ambos, junto con cualquier otra cosa cuyo camino simplemente contenga .pdf.

sin un $, la coincidencia es un Coincidencia de prefijo, que tropieza constantemente con la gente. Disallow: /admin bloques /admin, /admin/, /admin/users, y también /administrator y /admin-tools, porque todos ellos comienzan con la cadena /admin. Si te referías solo al directorio, escribe /admin/.

El retraso de rastreo no se respeta universalmente

Crawl-delay: 10 Le pide a un rastreador que espere diez segundos entre solicitudes. Bing, Yandex y varios rastreadores más pequeños lo honran. Googlebot lo ignora por completo- Google ajusta la velocidad de rastreo según los tiempos de respuesta del servidor y la configuración en Search Console, no según una directiva de su archivo. Establecer un gran retraso de rastreo en un sitio grande es una pistola de pie en cámara lenta: a 10 segundos por solicitud, un sitio de 100.000 páginas tarda casi doce días en rastrearse una vez y, en la práctica, gran parte de él nunca se rastrea. Si el rastreo realmente daña su servidor, arregle el servidor o almacene en caché las páginas; Estrangular el rastreador en su mayor parte simplemente lo hace invisible.

Bloqueo de rastreadores de IA

Los rastreadores de IA se dividen en dos categorías que la gente combina habitualmente. Los rastreadores de entrenamiento (GPTBot, ClaudeBot, CCBot, Bytespider, Google-Extended) recopilan contenido utilizado para entrenar modelos. Los rastreadores de motores de respuestas, de los cuales PerplexityBot es el ejemplo más claro, recuperan páginas para que puedan citarse en las respuestas generadas, lo que puede enviarle tráfico de referencia. Bloquear la primera categoría protege su contenido de ser absorbido por un modelo; bloquear el segundo te elimina de una superficie donde de otro modo podrías ser citado.

Google-Extended Merece una nota específica porque su nombre engañosa. No es un rastreador. Es un token que controla si el contenido que ya se ha obtenido por Googlebot puede utilizarse para el entrenamiento de Gemini y Vertex AI. desautorizando tiene Ningún efecto En la búsqueda de Google, la indexación o la clasificación de búsqueda de Google. Puede rechazar el uso de capacitación de IA de Google y mantener su presencia de búsqueda completamente intacta.

Y la advertencia que se aplica a todos ellos: el cumplimiento es voluntario. Bloquear GPTbot detiene el rastreador declarado de OpenAI porque OpenAI elige honrar el archivo. No hace nada sobre un raspador que miente sobre su agente de usuario, y no hay ninguna directiva robs.txt que pueda hacerlo.

Referencia directiva

directivo amplitud proponerse honrado por
User-agent: abre un grupo Nombra a los rastreadores a los que se aplican las siguientes reglas. * es el catch-todo. todo el mundo
Disallow: dentro de un grupo Pide al rastreador que no busque URL que coincidan con la ruta. un desnudo Disallow: Sin valor significa "permitir todo". todo el mundo
Allow: dentro de un grupo Labra una excepción a partir de una más amplia Disallow. Gana lazos por el partido más largo. Google, Bing, la mayoría de los rastreadores modernos
Crawl-delay: dentro de un grupo Segundos mínimos entre solicitudes. Bing, Yandex, otros - no bot de google
Sitemap: mundial URL absoluta de un mapa de sitio o índice de mapa del sitio. Se aplica a todos los rastreadores, independientemente de la ubicación. Google, Bing, la mayoría de los rastreadores
Host: mundial Espejo/dominio preferido. una extensión de Yandex. Solo Yandex
Noindex: - no funciona Google abandonó el soporte en 2019. Usa un noindex Metaetiqueta o X-Robots-Tag cabecera don nadie
# a cualquier parte Comentar. Todo lo que está en la línea se ignora. todo el mundo

Casos de uso comunes

Mantener la basura fuera del índice sin bloquear nada importante

El trabajo de pan y mantequilla: bloquear URL de búsqueda facetada, cadenas de consulta de ID de sesión, resultados de búsqueda internos y páginas de carrito o caja para que los rastreadores gasten su presupuesto en páginas que realmente puedan clasificarse. La trampa está sobrebloqueando. una regla como Disallow: /*? Bloquea cada URL con una cadena de consulta, que en muchos sitios incluye páginas de categoría paginadas que deseas rastrear. Pruebe los patrones antes de enviarlos.

Tomando un sitio de puesta en escena oscuro

User-agent: * más Disallow: / es la llamada correcta para un entorno de puesta en escena o vista previa, y el bloque todo lo preestablecido lo produce. Pero trate esto como higiene, no como seguridad: los entornos de puesta en escena también deben estar detrás de la autenticación HTTP o una lista de permitidos IP, porque robots.txt no oculta el host ni impide que nadie lo explore. Y el archivo nunca, jamás debe promocionarse a producción, póngalo en el proceso de implementación & #39;s revisión diferencial, porque este error exacto es la forma más común en que los sitios desaparecen de Google.

Arreglando un sitio que ha abandonado la búsqueda

Cuando el tráfico orgánico se cae por un precipicio, /robots.txt Es lo primero que debe verificar, antes de que se actualice el algoritmo y las auditorías de backlink. Pegue el archivo en vivo en el generador y lea la salida del validador. un callejero Disallow: /, una regla que bloquea el CSS y el bot de Google JavaScript necesita renderizar la página, o una Googlebot grupo que accidentalmente anula un cuidadosamente escrito * El grupo aparecerá inmediatamente.

Decidir qué pueden hacer los rastreadores de IA con su contenido

Los editores, los sitios de documentación y cualquier persona cuyo contenido sea el producto ahora tienen una decisión real que tomar sobre el entrenamiento de rastreadores. El ajuste preestablecido de rastreadores Block AI le brinda un valor predeterminado defendible (se aceptan motores de búsqueda, se rechazan los rastreadores de entrenamiento) y la tabla de rastreadores explica cada uno para que pueda hacer excepciones deliberadamente, como mantener PerplexityBot permitido para el tráfico de referencia mientras rechaza los robots de entrenamiento puros.

Auditar un sitio heredado

Te haces cargo de un sitio y nadie sabe por qué /resources/ no está indexado. Importe el Live Robots.txt, ejecute el probador contra las rutas en cuestión y la herramienta nombra la regla exacta al hacerlo. Esto toma un minuto y reemplaza una tarde de adivinanzas.

¿Por qué generar robots.txt en el navegador?

los Generador de robots.txt se ejecuta completamente del lado del cliente. Sus rutas, nombres de host y reglas nunca salen de la máquina, lo cual importa más de lo que parece: la estructura del directorio de un producto inédito, la URL de un host de preparación y las rutas internas que está tratando de mantener en silencio son cosas que vale la pena no pegar. en otra persona &#39;s registros del servidor. Una vez cargada la página, funciona sin conexión y la salida es un archivo de texto sin formato que posee.

Robots.txt se encuentra junto a algunos trabajos vecinos. los Generador de metaetique produce el noindex y las etiquetas canónicas que hacen el trabajo robots.txt no pueden. los Abrir vista previa del gráfico Muestra cómo se renderizarán sus enlaces una vez que esos rastreadores que haya permitido que los vengan y los busquen. y el generador de babosas Construye las rutas limpias con las que terminarán coincidiendo las reglas.

preguntasrán el

¿Dónde pongo el archivo robots.txt?

Debe servirse exactamente /robots.txt en el host se aplica, por ejemplo https://example.com/robots.txt. Los rastreadores no miran a ningún otro lado. un archivo en /blog/robots.txt se ignora por completo, y el archivo en example.com no gobierna shop.example.com; cada anfitrión necesita lo suyo. servirlo con un estado de 200 y un text/plain Tipo de contenido.

¿Anular eliminar una página de Google?

No, y este es el malentendido más importante sobre el formato. No permitir que Google evite que busque una página; no elimina la URL del índice. Si otros sitios se vinculan a una URL bloqueada, Google aún puede enumerarla, generalmente sin descripción porque nunca lee la página. Para mantener una página fuera de los resultados de búsqueda, permita que se gatee y sirva a un noindex Meta etiqueta de los robots o una X-Robots-Tag cabecera Si bloquea la URL, el rastreador nunca puede ver el noindex que agregó.

¿Es Robots.txt una forma de ocultar páginas privadas?

No. Es un archivo público que cualquiera puede leer, y cumplirlo es voluntario; los raspadores maliciosos lo ignoran por completo. Listado /internal-admin/ En sus reglas de no permitir que cada atacante le diga exactamente dónde buscar. Cualquier cosa que deba permanecer privada necesita autenticación, una IP Allowlist o no estar en la Internet pública en absoluto.

¿Cómo permiten interactuar y no permitir interactuar cuando ambos coinciden con una URL?

La regla más específica gana, donde la especificidad significa la longitud del patrón de ruta. dado Disallow: /admin y Allow: /admin/public, la URL /admin/public se permite porque el patrón Permitir es más largo, mientras que /admin/secret está bloqueado. Si dos patrones tienen exactamente la misma longitud, permita ganar. Las reglas de pedido aparecen en el archivo No importa, lo que sorprende a las personas que esperan un comportamiento de primer partido al estilo de firewall.

¿Qué hacen los comodines * y $?

Un asterisco coincide con cualquier racha de caracteres, por lo que Disallow: /*?sessionid= Bloquea cualquier URL que contenga ese parámetro. Un signo de dólar ancla el final de la URL, por lo que Disallow: /*.pdf$ bloques /report.pdf pero no /report.pdf?download=1. sin un $, la coincidencia es una coincidencia de prefijo: Disallow: /admin bloques /admin, /admin/users, y también /administrator, porque todos ellos comienzan con esa cadena.

¿Cómo bloqueo los rastreadores de IA como gptbot y claudebot?

dar a cada uno su propio grupo con Disallow: /. El preset de rastreadores de IA de bloques hace esto para GPTbot, Claudebot, PerplexityBot, CCbot, Google-Extended, Bytespider y Anthropic-AI con un solo clic y dejando libre de GoogleBot y Bingbot para rastrear. Tenga en cuenta que Google-extendido solo controla el uso de la capacitación para Gemini y Vertex AI y no tiene ningún efecto en la búsqueda de Google. El cumplimiento es voluntario, por lo que esto detiene a los rastreadores cooperativos, no a los raspadores determinados.

¿Funciona realmente el retraso de rastreo?

Depende del rastreador. Googlebot lo ignora por completo: la velocidad de rastreo se ajusta desde la consola de búsqueda y desde los tiempos de respuesta de su servidor &#39. Bing, Yandex y varios rastreadores más pequeños lo respetan, tratando el valor como el número mínimo de segundos entre solicitudes. Establecer un gran retraso en un sitio grande puede significar que la mayoría de las páginas nunca se rastrean en absoluto, así que mantenga los valores pequeños y corrija la capacidad del servidor si el rastreo es realmente un problema.

¿Qué sucede si mi robots.txt tiene un error de sintaxis?

Los rastreadores descartan silenciosamente las líneas que no pueden analizar y continuar con el resto, por lo que una regla rota falla silenciosamente en lugar de en voz alta. una directiva desconocida, una ruta que falta su barra inclinada principal o una regla colocada por encima de la primera User-agent: La línea simplemente no hace nada, y no lo descubrirás hasta que tu tráfico se mueva. Para eso es exactamente para lo que está el validador: informa cada uno de estos con un número de línea antes de implementar.

Frequently Asked Questions

It must be served at exactly /robots.txt on the host it applies to — for example https://example.com/robots.txt. Crawlers look nowhere else. A file at /blog/robots.txt is ignored entirely, and the file on example.com does not govern shop.example.com; each host needs its own. Serve it with a 200 status and a text/plain content type.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!