Command Palette

Search for a command to run...

Générateur robots.txt : créez, validez et testez des règles d'exploration sans désindexer votre site

T
Toolz Team
|Jul 19, 2026|21 min read

Les quatre personnages les plus chers que j'ai jamais vus expédiés étaient Disallow: /. Une équipe a poussé un robot de mise en scène.txt en production lors d'une sortie, personne ne l'a remarqué, et au cours des dix jours suivants, Google a discrètement abandonné la plupart des pages du site. Le trafic n'a pas planté d'une manière qui déclenche les alarmes, il s'est épuisé. Au moment où quelqu'un a pensé à vérifier /robots.txt, la reprise a été un mois de ré-exploration. Le fichier qui lui a causé était de quatre lignes.

Robots.txt est d'une simplicité trompeuse. C'est du texte brut, il a peut-être six directives à connaître et la syntaxe s'adapte sur une fiche. Cette simplicité est exactement la raison pour laquelle cela ne va pas : il n'y a pas de construction, pas de linter dans votre CI, aucun système de type et aucun message d'erreur. Si vous écrivez une règle qu'un robot d'exploration ne peut pas analyser, le robot d'exploration ignore silencieusement cette ligne et continue. Votre fichier semble correct, votre site semble correct et quelque chose que vous pensiez bloqué est en cours d'exploration - ou quelque chose dont vous aviez besoin, l'exploration ne l'est pas.

je construis toolz.dev Et j'écris constamment des fichiers robots.txt pour les environnements de staging, les sites clients et mes propres projets, alors j'ai construit le Générateur robots.txt Pour rendre les modes de défaillance visibles. Il construit le fichier à partir d'une forme structurée, de sorte que la syntaxe est juste par construction. Il s'apprête à s'employer à ce que vous avez écrit et appelle les canons avec des numéros de ligne. Et il teste une URL par rapport à vos règles en utilisant la même préséance de précédents les plus longues que les véritables robots d'exploration utilisent, vous pouvez donc prouver qu'une page est accessible avant de déployer plutôt qu'après que la console de recherche vous ait dit que non.

tl;dr : Robots.txt indique aux robots ce qu'ils peuvent récupérer. Il ne supprime pas les pages des résultats de recherche et ne protège rien de privé. Le fichier est public et la conformité est volontaire. Les règles ne s'appliquent qu'à l User-agent: groupe, les chemins doivent commencer par /, * correspond à n'importe quoi, un suivi $ Ancre la fin, et lorsque deux règles correspondent, le modèle le plus long gagne avec Permet de casser les liens. le Générateur robots.txt Construit, peluche et teste tout cela dans votre navigateur.

Ce que robots.txt contrôle réellement

Robots.txt est une directive d'exploration, pas une directive d'index. Cette distinction unique explique la plupart de la confusion qui l'entoure.

Lorsqu'un crawler veut récupérer une URL sur votre hôte, il va d'abord chercher https://yourhost/robots.txt et vérifie si l'URL est autorisée. si un Disallow Les correspondances de règles, un robot d'exploration bien élevé ne demande pas la page. C'est tout le mécanisme. Il régit la requête HTTP, et rien d'autre.

Ce qu'il ne fait pas, c'est supprimer une URL de l'index de recherche. Google peut et fait des URL d'index qu'il n'a jamais récupérés, en utilisant uniquement le texte d'ancrage et le contexte des liens pointant vers eux. Si vous bloquez /pricing Dans robots.txt et cinquante sites, l'indication de /pricing, Google peut toujours afficher cette URL dans les résultats, généralement sans description, car il n'a jamais lu la page. Bloquer une URL que vous souhaitez hors recherche fonctionne activement contre vous : le noindex Balise qui le supprimerait vit à l'intérieur de la page, et un robot d'exploration qui n'est pas autorisé à récupérer la page ne peut jamais la voir. La bonne séquence est d'autoriser l'exploration, de servir <meta name="robots" content="noindex"> ou un X-Robots-Tag: noindex En-tête, attendez que la page se désiste, puis bloquez-la uniquement si vous souhaitez enregistrer le budget d'exploration.

Il ne protège pas non plus. Robots.txt est diffusé publiquement sur un chemin connu ; n'importe qui, y compris chaque attaquant sur Internet, peut lire le vôtre dans un navigateur. un Disallow: /internal-admin-v2/ Line est un panneau indiquant la chose que vous vouliez cachée. Les racleurs malveillants ignorent entièrement le dossier - le respect est une convention volontaire, pas un mécanisme d'application. Tout ce qui doit être privé nécessite une authentification ou une liste d'autorisations IP. Robots.txt est une demande, poliment faite, aux robots d'exploration qui choisissent d'écouter.

Principales caractéristiques du générateur robots.txt

Éditeur de groupe structuré

La grammaire du fichier est des groupes : un ou plusieurs User-agent: lignes suivies des règles qui leur sont applicables. Écrire que manuellement invite le bogue structurel le plus courant, qui est une règle flottant au-dessus du premier User-agent: Ligne où elle ne s'applique à personne. Le générateur construit des groupes en tant qu'objets de première classe, donc chaque règle que vous ajoutez appartient nécessairement à un groupe.

Un validateur qui rapporte les vrais pieds de marche

Le linter fonctionne sur chaque frappe et signale les erreurs, les avertissements et les notes avec des numéros de ligne. Il signale des règles en dehors de tout groupe, les chemins manquant leur barre oblique, un nu Disallow: Sans valeur (ce qui signifie "autoriser tout" et n'est presque jamais ce que l'auteur voulait dire), des URL de sitemap qui ne sont pas absolues, $ Utilisé partout mais à la fin d'un modèle, des directives inconnues, dupliquer des groupes d'agents d'utilisateurs et, à haute voix, un Disallow: / assis sous User-agent: *.

Un vrai testeur d'URL

Entrez un chemin d'accès et un agent-utilisateur et les rapports d'outils autorisés ou interdits, ainsi que la règle exacte qui l'a décidé. La logique de priorité est la vraie de RFC 9309 : Le modèle de trajectoire correspondant le plus long gagne, quelles que soient les règles de commande qui apparaissent dans le fichier, et si deux modèles ont la même longueur, autorisez les temps de battage. C'est la partie que les gens se trompent le plus souvent d'intuition, car il ne se comporte pas comme les règles du premier match-gagnants d'un pare-feu.

Préréglages en un clic

Autorisez tout, bloquez tout, WordPress, Shopify, Next.js et bloquez les robots d'intelligence artificielle remplissent chacun le formulaire avec un point de départ correct et sensible. Les blocs prédéfinis WordPress /wp-admin/ tout en sculptant /wp-admin/admin-ajax.php, que de nombreux fichiers manuscrits oublient et cassent ainsi la fonctionnalité frontale dont Google a besoin pour rendre la page.

Commandes de robots d'exploration d'IA

Un clic ajoute des groupes de refus pour GPTBot, ClaudeBot, PerplexityBot, CCBOT, Google-Extended, ByTespider et Anthropic-AI, tout en laissant Googlebot et Bingbot libres de s'explorer. La table de robots d'exploration connue explique ce que fait réellement chaque bot, vous faites donc un choix éclairé plutôt que de coller une liste d'un article de blog.

Analyse votre fichier existant

Collez les robots.txt que vous servez déjà et l'outil le lit dans des groupes modifiables. La plupart des travaux de robots.txt ne sont pas Greenfield - il s'agit d'auditer et de réparer quelque chose d'écrit il y a trois ans par quelqu'un qui est parti - et à partir de ce qui est réellement en direct est la seule façon sensée de le faire.

Tout reste dans votre navigateur

Le fichier est généré, ou entièrement testé et testé entièrement en JavaScript côté client. Rien n'est téléchargé, vous pouvez donc rédiger des règles en toute sécurité pour un hôte de transfert ou une section non annoncée d'un site, et l'outil fonctionne hors ligne une fois chargé.

Comment utiliser le générateur robots.txt

Étape 1 : Démarrez à partir d'un préréglage ou importez ce que vous avez déjà

Si vous commencez à nouveau, choisissez le préréglage le plus proche de votre pile. Si vous servez déjà un robots.txt, extrayez-le à partir de https://yoursite.com/robots.txt, collez-le dans la zone Importer et cliquez sur Parse dans les groupes. L'outil reconstruit la structure du groupe et le validateur vous indique immédiatement ce qui ne va pas avec le fichier que vous avez exécuté en production.

Étape 2 : Créez vos groupes d'utilisateurs-utilisateurs

Chaque groupe cible un ou plusieurs crawlers. Ajoutez des crawlers à partir de la liste des bots connus ou tapez directement un jeton - les jetons sont assortis de manière insensible aux cas, donc googlebot et Googlebot sont équivalents. Un groupe avec * est le fourre-tout : cela s'applique à tout robot d'exploration qui n'a pas de groupe plus spécifique qui lui est propre.

La chose essentielle à intérioriser ici est que les robots obéissent exactement à un groupe. Googlebot lit le Googlebot groupe si l'un existe et ignore le * Groupe entièrement — il ne les fusionne pas. Si vous créez un Googlebot groupe Pour ajouter une règle, vous devez répéter chaque règle de la * Groupement à l'intérieur, ou Googlebot cessera de tout obéir à tous. Cela surprend presque tout le monde la première fois.

Étape 3 : Ajoutez des règles, des sitesmaps et lisez le validateur

Ajoutez des chemins de suppression pour ce que vous voulez que les robots d'exploration sautent et autorisez les chemins d'accès pour les exclusions à l'intérieur. Ajoutez un délai d'exploration uniquement si vous ciblez un moteur qui en honore un. Ajoutez vos URL de sitemap - celles-ci doivent être absolues, y compris le schéma et l'hôte, et elles s'élèvent en dehors de n'importe quel groupe, s'appliquant à tout le monde.

Lisez ensuite le validateur. Les erreurs sont des choses qui ne fonctionneront pas. Les avertissements sont des choses qui ne signifient probablement pas ce que vous pensez. Les notes sont des opportunités. Réparez tout ce qui est rouge avant d'aller plus loin.

Étape 4 : Testez les URL qui vous intéressent réellement

C'est l'étape que les gens sautent et ne devraient pas. Prenez les trois ou quatre chemins dont le statut d'exploration est vraiment important - vos pages de produits, votre blog, la route d'administration que vous pensez avoir bloqué, le fichier CSS dont Google a besoin pour rendre votre mise en page - et testez chacun contre Googlebot. L'outil vous indique autorisé ou interdit et nomme la règle responsable. Si un résultat vous surprend, vos règles ne disent pas ce que vous pensez qu'ils disent, et il est beaucoup moins cher de l'apprendre maintenant.

Étape 5 : Copiez ou téléchargez et déployez-le à la racine

Copiez le fichier ou téléchargez robots.txt, puis servez-le exactement à https://yourhost/robots.txt avec un 200 statut et un text/plain Type de contenu. Nulle part ailleurs ne fonctionne. /blog/robots.txt n'est lu par personne.

Le protocole d'exclusion des robots, en détail

C'est enfin une norme

Pendant vingt-cinq ans, robots.txt était une convention décrite dans un article de la liste de diffusion de 1994, et les robots d'exploration ont chacun interprété les ambiguïtés à leur manière. En 2022, il a été publié sous le nom RFC 9309, qui codifie les règles d'analyse, la sémantique correspondante et l'ordre de priorité sur lequel Google, Bing et les robots d'exploration les plus sérieux avaient convergé. Lorsque ce guide indique que "la règle est x", cela signifie que RFC 9309 dit X - pas qu'un article de blog l'affirme.

Les groupes et pourquoi les robots d'exploration n'obéissent qu'à un seul

Un enregistrement consiste en un ou plusieurs User-agent: Lignes suivies des lignes de règles qui s'appliquent à eux. Un robot d'exploration s'identifie avec un jeton de produit — Googlebot, Bingbot, GPTBot — et recherche le groupe dont le jeton correspond le plus spécifiquement. Il obéit à ce groupe et à aucun autre. le * Le groupe est le repli, utilisé uniquement lorsque rien de plus spécifique ne correspond.

La conséquence pratique mérite de répéter car elle cause tant de dégâts : les groupes n'héritent pas. Un fichier qui lit

User-agent: *
Disallow: /admin/
Disallow: /cart

User-agent: Googlebot
Disallow: /internal/

signifie que googlebot peut s'analyser /admin/ et /cart librement. Il a trouvé son propre groupe, donc le * Le groupe est invisible. Si vous souhaitez que Googlebot soit bloqué des trois, les trois règles doivent apparaître dans le Googlebot groupe.

Priorité la plus longue

Lorsque deux règles ou plus du groupe correspondant correspondent à une URL, le gagnant est celui avec le Modèle de chemin le plus long, mesuré en caractères. La commande dans le fichier n'est pas pertinente. Si la durée de correspondance la plus longue et la plus longue interruption de correspondance sont de la même longueur, autorisez les victoires.

User-agent: *
Disallow: /admin
Allow: /admin/public

Selon ces règles, /admin/public/logo.png est permis — Le modèle d'autorisation est de 13 caractères contre le 6 – -  /admin/secret est rejeté, car seul le motif de refus est conforme. C'est le mécanisme derrière chaque "blocage du répertoire, autorise un fichier à l'intérieur", y compris WordPress admin-ajax.php Exclusion. C'est aussi pourquoi l'écriture de règles descendantes comme une configuration de pare-feu produit de mauvaises intuitions : il n'y a pas de gains de première correspondance, pas de chute et pas de commande.

Wildcards et l'ancre finale

Deux caractères spéciaux sont pris en charge dans les modèles de chemin.

* Correspond à n'importe quelle séquence de caractères, y compris aucun. Disallow: /*?sessionid= Bloque toute URL contenant ce paramètre de requête n'importe où.

$ Ancre la fin de l'URL et signifie uniquement que lorsqu'il s'agit du caractère final du motif. Disallow: /*.pdf$ blocs /whitepaper.pdf mais pas /whitepaper.pdf?download=1, parce que cette URL ne s'arrête pas à .pdf. Laisse tomber le $ Et vous bloquez les deux - ainsi que tout ce dont le chemin contient simplement .pdf.

sans $, la correspondance est un correspondance préfixe, qui fait trébucher les gens constamment. Disallow: /admin blocs /admin, /admin/, /admin/users, et aussi /administrator et /admin-tools, parce que tous commencent par la chaîne /admin. Si vous ne vouliez dire que le répertoire, écrivez /admin/.

Le retard de crawl n'est pas universellement honoré

Crawl-delay: 10 Demande à un crawler d'attendre dix secondes entre les demandes. Bing, Yandex et divers petits robots honorent. Googlebot l'ignore complètement — Google ajuste le taux d'analyse en fonction des temps de réponse du serveur et du paramètre dans la Search Console, et non sur une directive de votre fichier. Définir un grand délai d'exploration sur un grand site est un pied-de-l'air au ralenti : à 10 secondes par demande, un site de 100 000 pages prend près de douze jours pour ramper une fois, et dans la pratique, une grande partie ne s'y explore jamais du tout. Si l'exploration est vraiment nocive sur votre serveur, corrigez le serveur ou mettez en cache les pages ; la limitation de la robotisation vous rend principalement invisible.

Bloquer les robots d'exploration d'IA

Les robots d'exploration d'IA se divisent en deux catégories que les gens confondent régulièrement. Les robots d'entraînement d'entraînement - GPTBOT, Claudebot, CCBOT, ByTespider, Google-Agranded - rassemblent le contenu utilisé pour former des modèles. Les robots d'exploration de moteur de réponse, dont PerplexityBot est l'exemple le plus clair, récupérez les pages afin qu'elles puissent être citées dans les réponses générées, qui peuvent vous envoyer du trafic de référence. Le blocage de la première catégorie protège votre contenu contre l'absorption d'un modèle ; bloquer la seconde vous éloigne d'une surface où vous pourriez autrement être cité.

Google-Extended mérite une note spécifique car son nom est trompe. Ce n'est pas un robot d'exploration. Il s'agit d'un jeton qui contrôle si le contenu déjà récupéré par Googlebot peut être utilisé pour la formation Gemini et Vertex AI. L'interdire a Aucun effet Dans le cadre de la recherche Google, l'indexation ou le classement. Vous pouvez refuser l'utilisation de l'IA de Google et conserver votre présence de recherche entièrement intacte.

Et la mise en garde qui s'applique à chacun d'eux : la conformité est volontaire. Le blocage de GPTBOT arrête le robot d'exploration déclaré d'OpenAi, car OpenAI choisit d'honorer le fichier. Il ne fait rien sur un scraper qui ment sur son agent d'utilisateur, et il n'y a pas de directive robots.txt qui le peut.

Référence directive

directeur étendue intention honoré par
User-agent: Ouvre un groupe Nommer le ou les robots d'exploration auxquels les règles suivantes s'appliquent. * est le fourre-tout. chacun
Disallow: au sein d'un groupe Demande au robot de lecture de ne pas récupérer les URL correspondant au chemin. un nu Disallow: Sans valeur, c'est "autoriser tout". chacun
Allow: au sein d'un groupe s'il est stipulé une exception à un plus large Disallow. Gagne des égalités par match le plus long. Google, Bing, les robots d'exploration les plus modernes
Crawl-delay: au sein d'un groupe Minimum de secondes entre les demandes. Bing, Yandex, autres — pas googlebot
Sitemap: global URL absolue d'un sitemap ou d'un index de plan de site. S'applique à tous les robots d'exploration, quel que soit le placement. Google, Bing, la plupart des robots d'exploration
Host: global Miroir/domaine préféré. Une extension Yandex. Yandex uniquement
Noindex: ne fonctionne pas. Google a abandonné le support en 2019. utiliser un noindex balise méta ou X-Robots-Tag en-tête. personne
# n'importe où Commentaire. Tout ce qui suit sur la ligne est ignoré. chacun

Cas d'utilisation courants

Garder la malbouffe hors de l'index sans bloquer quoi que ce soit d'important

Le travail de pain et de beurre : bloquer les URL de recherche facettes, les chaînes de requête de session-ID, les résultats de recherche internes et les pages de panier ou de paiement afin que les robots d'exploration dépensent leur budget sur des pages qui peuvent réellement se classer. Le piège est trop bloquant. Une règle comme Disallow: /*? Bloque chaque URL avec une chaîne de requête, qui sur de nombreux sites comprend des pages de catégorie paginées dont vous souhaitez vraiment être analysées. Testez les modèles avant de les expédier.

Prendre un site de mise en scène sombre

User-agent: * plus Disallow: / est le bon appel pour un environnement de mise en scène ou de prévisualisation, et le bloc que tout prédéfini le produit. Mais traitez cela comme une hygiène, pas une sécurité : les environnements de mise en scène doivent également être derrière HTTP Auth ou une liste d'autorisations IP, car robots.txt ne cache pas l'hôte ni n'empêche quiconque de le parcourir. Et le fichier ne doit jamais, jamais être promu en production - le placer dans l'examen du Diff de Deploy Pipeline, car cette erreur exacte est la façon la plus courante de disparaitre les sites de Google.

Réparation d'un site qui a abandonné la recherche

Lorsque le trafic organique tombe d'une falaise, /robots.txt est la première chose à vérifier avant la mise à jour de l'algorithme et les audits de backlink. Collez le fichier en direct dans le générateur et lisez la sortie du validateur. un errant Disallow: /, une règle qui bloque le CSS et le Googlebot JavaScript pour rendre la page ou un Googlebot groupe qui remplace accidentellement un écrit soigneusement * Le groupe apparaîtra immédiatement.

Décider de ce que les robots d'exploration d'IA peuvent faire avec votre contenu

Les éditeurs, les sites de documentation et toute personne dont le contenu est le produit ont désormais une véritable décision à prendre concernant les robots d'entraînement. Le préréglage Block AI Crawlers vous donne une valeur par défaut défendable - les moteurs de recherche sont les bienvenus, les robots de formation ont refusé - et la table des robots explique chacun afin que vous puissiez faire des exceptions de manière délibérée, comme garder PerplexityBot autorisé pour le trafic de référence tout en refusant les robots d'entraînement pur.

Auditer un site hérité

Vous prenez le contrôle d'un site et personne ne sait pourquoi /resources/ n'est pas indexé. Importez le Live Robots.txt, exécutez le testeur sur les chemins en question et l'outil nomme la règle exacte qui le fait. Cela prend une minute et remplace un après-midi de devinette.

Pourquoi générer des robots.txt dans le navigateur

le Générateur robots.txt Fonctionne entièrement côté client. Vos chemins, noms d'hôte et règles ne quittent jamais la machine, ce qui compte plus qu'il n'y paraît - la structure de répertoires d'un produit inédit, l'URL d'un hôte de mise en scène et les itinéraires internes que vous essayez de garder en silence valent la peine de ne pas coller dans les journaux de serveur de quelqu'un d'autre. Une fois la page chargée, elle fonctionne hors connexion et la sortie est un fichier de texte brut que vous possédez.

Robots.txt s'inscrit dans quelques emplois voisins. le Générateur de balises produit le noindex et les balises canoniques qui font le travail robots.txt ne peuvent pas. le Ouvrir un aperçu du graphique Montre comment vos liens seront rendus une fois que les robots d'exploration que vous avez autorisés à venir les chercher. et le générateur de limace Construit les chemins propres auxquels vos règles finiront par correspondre.

FAQ

Où puis-je mettre le fichier robots.txt ?

Il doit être servi à exactement /robots.txt Sur l'hôte auquel il s'applique, par exemple https://example.com/robots.txt. Les robots d'exploration ne cherchent nulle part ailleurs. un fichier à /blog/robots.txt est entièrement ignoré et le fichier sur example.com ne gouverne pas shop.example.com; chaque hôte a besoin de son propre. Servez-le avec un statut 200 et un text/plain Type de contenu.

Interdire la suppression d'une page de Google ?

Non, et c'est le malentendu le plus important à propos du format. Interdire l'arrêt Google empêche Google de récupérer une page, il ne supprime pas l'URL de l'index. Si d'autres sites sont liés à une URL bloquée, Google peut toujours la répertorier, généralement sans description car il n'a jamais lu la page. Pour garder une page hors des résultats de recherche, autorisez l'exploration et servez un noindex Balise méta de robots ou un X-Robots-Tag en-tête. Si vous bloquez l'URL, le robot d'exploration ne peut jamais voir le noindex que vous avez ajouté.

Robots.txt est-il un moyen de masquer des pages privées ?

non . C'est un dossier public que tout le monde peut lire, et le rendre hommage est volontaire - les racleurs malveillants l'ignorent complètement. inscription /internal-admin/ Dans vos règles de refus, indiquez à chaque attaquant exactement où chercher. Tout ce qui doit rester privé a besoin d'authentification, une liste d'autorisation IP ou de ne pas être du tout sur Internet public.

Comment autoriser et interdire l'interaction lorsque les deux correspondent à une URL ?

La règle la plus spécifique gagne, lorsque la spécificité signifie la longueur du modèle de trajectoire. donné Disallow: /admin et Allow: /admin/public, l'URL /admin/public est autorisée car le modèle d'autorisation est plus long, tandis que /admin/secret est bloqué. Si deux modèles ont exactement la même longueur, autorisez les gains. Les règles de commande apparaissent dans le fichier, ce qui surprend les personnes qui attendent un comportement de premier match de pare-feu.

Que font les caractères génériques * et $ ?

Un astérisque correspond à n'importe quel nombre de caractères, donc Disallow: /*?sessionid= Bloque toute URL contenant ce paramètre. Un signe dollar ancre la fin de l'URL, donc Disallow: /*.pdf$ blocs /report.pdf mais pas /report.pdf?download=1. sans $, la correspondance est une correspondance de préfixe : Disallow: /admin blocs /admin, /admin/users, et aussi /administrator, parce que tous commencent par cette chaîne.

Comment bloquer les robots d'exploration d'IA comme GPTBOT et Claudebot ?

Donnez à chacun son propre groupe avec Disallow: /. Le préréglage Block AI Crawlers le fait pour GPTBot, Claudebot, PerplexityBot, CCBot, Google-Extended, ByTespider et Anthropic-AI en un seul clic tout en laissant Googlebot et Bingbot libres d'explorer. Notez que Google-Extended ne contrôle que l'utilisation de l'entraînement pour Gemini et Vertex AI et n'a aucun effet sur la recherche Google. La conformité est volontaire, ce qui empêche les robots d'exploration de coopération, non les racleurs non déterminés.

Le délai de crawl fonctionne-t-il réellement ?

Cela dépend du robot d'exploration. Googlebot l'ignore complètement. Le taux d'exploration est ajusté à partir de la Search Console et des temps de réponse de votre serveur. Bing, Yandex et plusieurs petits robots honorent, en traitant la valeur comme le nombre minimum de secondes entre les demandes. La définition d'un délai important sur un grand site peut signifier que la plupart des pages ne sont jamais explorées, alors gardez les valeurs petites et corrigez la capacité du serveur si l'exploration est vraiment un problème.

Que se passe-t-il si mon robots.txt a une erreur de syntaxe ?

Les robots d'exploration écartent silencieusement les lignes qu'ils ne peuvent pas analyser et continuer avec le reste, de sorte qu'une règle enfreinte échoue silencieusement plutôt qu' bruyamment. une directive inconnue, un chemin manquant sa barre oblique ou une règle placée au-dessus du premier User-agent: Line ne fait rien, et vous ne le saurez pas tant que votre trafic n'aura pas bougé. C'est exactement à cela que sert le validateur : il signale chacun d'entre eux avec un numéro de ligne avant de déployer.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!