Les quatre personnages les plus chers que j'ai jamais vus expédiés étaient Disallow: /. Une équipe a poussé un robot de mise en scène.txt en production lors d'une sortie, personne ne l'a remarqué, et au cours des dix jours suivants, Google a discrètement abandonné la plupart des pages du site. Le trafic n'a pas planté d'une manière qui déclenche les alarmes, il s'est épuisé. Au moment où quelqu'un a pensé à vérifier /robots.txt, la reprise a été un mois de ré-exploration. Le fichier qui lui a causé était de quatre lignes.
Robots.txt est d'une simplicité trompeuse C'est du texte brut, il a peut-être six directives qui valent la peine d'être connues, et la syntaxe s'adapte sur une carte d'index Cette simplicité est exactement la raison pour laquelle il va mal : il n'y a pas d'étape de construction, pas de linter dans votre CI, pas de système de types, et pas de message d'erreur Si vous écrivez une règle qu'un robot d'exploration ne peut pas analyser, le robot d'exploration ignore silencieusement cette ligne et continue Votre fichier a l'air bien, votre site a l'air bien, et quelque chose que vous pensiez bloqué est en train d'être rampé - ou quelque chose dont vous aviez besoin d'être rampé n'être.
je construis Toolz.dev Et j'écris constamment des fichiers robots.txt pour les environnements de staging, les sites clients et mes propres projets, alors j'ai construit le Générateur robots.txt Pour rendre les modes de défaillance visibles. Il construit le fichier à partir d'une forme structurée, de sorte que la syntaxe est juste par construction. Il s'apprête à s'employer à ce que vous avez écrit et appelle les canons avec des numéros de ligne. Et il teste une URL par rapport à vos règles en utilisant la même préséance de précédents les plus longues que les véritables robots d'exploration utilisent, vous pouvez donc prouver qu'une page est accessible avant de déployer plutôt qu'après que la console de recherche vous ait dit que non.
tl;dr : Robots.txt indique aux robots d'exploration ce qu'ils peuvent récupérer Il ne supprime pas les pages des résultats de recherche, et il ne protège rien de privé - le fichier est public, et la conformité est volontaire Les règles ne s'appliquent qu'à l'intérieur d'un
User-agent:groupe, les chemins doivent commencer par/,*correspond à n'importe quoi, un suivi$Ancre la fin, et lorsque deux règles correspondent, le modèle le plus long gagne avec Permet de casser les liens. le Générateur robots.txt Construit, peluche et teste tout cela dans votre navigateur.
Ce que robots.txt contrôle réellement
Robots.txt est une directive d'exploration, pas une directive d'index. Cette distinction unique explique la plupart de la confusion qui l'entoure.
Lorsqu'un crawler veut récupérer une URL sur votre hôte, il va d'abord chercher https://yourhost/robots.txt et vérifie si l'URL est autorisée. si un Disallow Les correspondances de règles, un robot d'exploration bien élevé ne demande pas la page. C'est tout le mécanisme. Il régit la requête HTTP, et rien d'autre.
Ce qu'il ne fait pas, c'est supprimer une URL de l'index de recherche. Google peut et fait des URL d'index qu'il n'a jamais récupérés, en utilisant uniquement le texte d'ancrage et le contexte des liens pointant vers eux. Si vous bloquez /pricing Dans robots.txt et cinquante sites, l'indication de /pricing« Google peut toujours afficher cette URL dans les résultats - généralement sans description, car elle ne lit jamais la page. Le blocage d'une URL que vous souhaitez hors recherche fonctionne activement contre vous : le noindex Balise qui le supprimerait vit à l'intérieur de la page, et un robot d'exploration qui n'est pas autorisé à récupérer la page ne peut jamais la voir. La bonne séquence est d'autoriser l'exploration, de servir <meta name="robots" content="noindex"> ou un X-Robots-Tag: noindex En-tête, attendez que la page se désiste, puis bloquez-la uniquement si vous souhaitez enregistrer le budget d'exploration.
Il ne protège pas non plus. Robots.txt est diffusé publiquement sur un chemin connu ; n'importe qui, y compris chaque attaquant sur Internet, peut lire le vôtre dans un navigateur. un Disallow: /internal-admin-v2/ line est un panneau indiquant ce que vous vouliez cacher Les grattoirs malveillants ignorent entièrement le fichier - l'honorer est une convention volontaire, pas un mécanisme d'application Tout ce qui doit être privé a besoin d'une authentification ou d'une liste d'autorisation IP. Robots.txt est une demande, poliment faite, aux robots qui choisissent d'écouter.
Principales caractéristiques du générateur robots.txt
Éditeur de groupe structuré
La grammaire du fichier est des groupes : un ou plusieurs User-agent: lignes suivies des règles qui leur sont applicables. Écrire que manuellement invite le bogue structurel le plus courant, qui est une règle flottant au-dessus du premier User-agent: Ligne où elle ne s'applique à personne. Le générateur construit des groupes en tant qu'objets de première classe, donc chaque règle que vous ajoutez appartient nécessairement à un groupe.
Un validateur qui rapporte les vrais pieds de marche
Le linter fonctionne sur chaque frappe et signale les erreurs, les avertissements et les notes avec des numéros de ligne. Il signale des règles en dehors de tout groupe, les chemins manquant leur barre oblique, un nu Disallow: Sans valeur (ce qui signifie "autoriser tout" et n'est presque jamais ce que l'auteur voulait dire), des URL de sitemap qui ne sont pas absolues, $ utilisé n'importe où sauf la fin d'un modèle, directives inconnues, groupes d'agents utilisateurs en double et - fort - a Disallow: / assis sous User-agent: *.
Un vrai testeur d'URL
Entrez un chemin et un agent-utilisateur et l'outil signale Autorisé ou refusé, plus la règle exacte qui l'a décidé La logique de préséance est la vraie de RFC 9309: le modèle de chemin correspondant le plus long gagne quelles que soient les règles d'ordre qui apparaissent dans le fichier, et si deux modèles ont la même longueur, Autoriser les battements Désavouer C'est la partie que les gens se trompent le plus souvent par intuition, car elle ne se comporte pas comme un pare-feu' ; les règles de premier match-gagne.
Préréglages en un clic
Autorisez tout, bloquez tout, WordPress, Shopify, Next.js et bloquez les robots d'intelligence artificielle remplissent chacun le formulaire avec un point de départ correct et sensible. Les blocs prédéfinis WordPress /wp-admin/ tout en sculptant /wp-admin/admin-ajax.php, que de nombreux fichiers manuscrits oublient et cassent ainsi la fonctionnalité frontale dont Google a besoin pour rendre la page.
Commandes de robots d'exploration d'IA
Un clic ajoute des groupes de refus pour GPTBot, ClaudeBot, PerplexityBot, CCBOT, Google-Extended, ByTespider et Anthropic-AI, tout en laissant Googlebot et Bingbot libres de s'explorer. La table de robots d'exploration connue explique ce que fait réellement chaque bot, vous faites donc un choix éclairé plutôt que de coller une liste d'un article de blog.
Analyse votre fichier existant
Collez les robots.txt que vous servez déjà et l'outil le lit à nouveau en groupes modifiables La plupart des robots.txt work n'est pas un nouveau champ - il s'agit d'auditer et de réparer quelque chose écrit il y a trois ans par quelqu'un qui est parti - et partir de ce qui est réellement en direct est le seul moyen sensé de le faire.
Tout reste dans votre navigateur
Le fichier est généré, ou entièrement testé et testé entièrement en JavaScript côté client. Rien n'est téléchargé, vous pouvez donc rédiger des règles en toute sécurité pour un hôte de transfert ou une section non annoncée d'un site, et l'outil fonctionne hors ligne une fois chargé.
Comment utiliser le générateur robots.txt
Étape 1 : Démarrez à partir d'un préréglage ou importez ce que vous avez déjà
Si vous commencez à nouveau, choisissez le préréglage le plus proche de votre pile. Si vous servez déjà un robots.txt, extrayez-le à partir de https://yoursite.com/robots.txt, collez-le dans la zone Importer et cliquez sur Parse dans les groupes. L'outil reconstruit la structure du groupe et le validateur vous indique immédiatement ce qui ne va pas avec le fichier que vous avez exécuté en production.
Étape 2 : Créez vos groupes d'utilisateurs-utilisateurs
Chaque groupe cible un ou plusieurs robots d'exploration Ajoutez des robots d'exploration à partir de la liste de robots connus ou tapez directement un jeton - les jetons correspondent de manière insensible à la casse, donc googlebot et Googlebot sont équivalents. Un groupe avec * est le fourre-tout : cela s'applique à tout robot d'exploration qui n'a pas de groupe plus spécifique qui lui est propre.
La chose essentielle à intérioriser ici est que les robots obéissent exactement à un groupe. Googlebot lit le Googlebot groupe si l'un existe et ignore le * regroupez entièrement - il ne les fusionne pas Si vous créez un Googlebot groupe Pour ajouter une règle, vous devez répéter chaque règle de la * Groupement à l'intérieur, ou Googlebot cessera de tout obéir à tous. Cela surprend presque tout le monde la première fois.
Étape 3 : Ajoutez des règles, des sitesmaps et lisez le validateur
Ajoutez des chemins de désaveu pour ce que vous souhaitez que les robots d'exploration ignorent et autorisez des chemins pour les exclusions à l'intérieur. Ajoutez un délai d'exploration uniquement si vous ciblez un moteur qui honore un. Ajoutez vos URL de plan de site - celles-ci doivent être absolues, y compris le schéma et l'hôte, et elles s'assoient en dehors de n'importe quel groupe, s'appliquant à tout le monde.
Lisez ensuite le validateur. Les erreurs sont des choses qui ne fonctionneront pas. Les avertissements sont des choses qui ne signifient probablement pas ce que vous pensez. Les notes sont des opportunités. Réparez tout ce qui est rouge avant d'aller plus loin.
Étape 4 : Testez les URL qui vous intéressent réellement
C'est l'étape que les gens sautent et ne devraient pas Prendre les trois ou quatre chemins dont le statut d'exploration compte vraiment - vos pages de produits, votre blog, la route d'administration que vous pensez avoir bloquée, le fichier CSS dont Google a besoin pour restituer votre mise en page - et tester chacun contre Googlebot L'outil vous dit Autorisé ou Désautorisé et nomme la règle responsable Si un résultat vous surprend, vos règles ne disent pas ce que vous pensez qu'elles disent, et il est beaucoup moins cher d'apprendre cela maintenant.
Étape 5 : Copiez ou téléchargez et déployez-le à la racine
Copiez le fichier ou téléchargez robots.txt, puis servez-le exactement à https://yourhost/robots.txt avec un 200 statut et un text/plain Type de contenu. Nulle part ailleurs ne fonctionne. /blog/robots.txt n'est lu par personne.
Le protocole d'exclusion des robots, en détail
C'est enfin une norme
Pendant vingt-cinq ans, robots.txt était une convention décrite dans un article de la liste de diffusion de 1994, et les robots d'exploration ont chacun interprété les ambiguïtés à leur manière. En 2022, il a été publié sous le nom RFC 9309[traduction], qui codifie les règles d'analyse, la sémantique de correspondance et l'ordre de préséance sur lequel Google, Bing et les robots d'exploration les plus sérieux avaient convergé Lorsque ce guide dit " ; la règle est X" ;, cela signifie que la RFC 9309 dit X - pas qu'un billet de blog l'affirme.
Les groupes et pourquoi les robots d'exploration n'obéissent qu'à un seul
Un enregistrement consiste en un ou plusieurs User-agent: lignes suivies des lignes de règles qui s'appliquent à eux Un robot d'exploration s'identifie à un jeton de produit - Googlebot, Bingbot, GPTBot- et cherche le groupe dont le jeton correspond le plus spécifiquement Il obéit à ce qu'un groupe et aucun autre Le * Le groupe est le repli, utilisé uniquement lorsque rien de plus spécifique ne correspond.
La conséquence pratique mérite de répéter car elle cause tant de dégâts : les groupes n'héritent pas. Un fichier qui lit
User-agent: *
Disallow: /admin/
Disallow: /cart
User-agent: Googlebot
Disallow: /internal/
signifie que googlebot peut s'analyser /admin/ et /cart librement. Il a trouvé son propre groupe, donc le * Le groupe est invisible. Si vous souhaitez que Googlebot soit bloqué des trois, les trois règles doivent apparaître dans le Googlebot groupe.
Priorité la plus longue
Lorsque deux règles ou plus du groupe correspondant correspondent à une URL, le gagnant est celui avec le Modèle de chemin le plus long, mesuré en caractères. La commande dans le fichier n'est pas pertinente. Si la durée de correspondance la plus longue et la plus longue interruption de correspondance sont de la même longueur, autorisez les victoires.
User-agent: *
Disallow: /admin
Allow: /admin/public
Selon ces règles, /admin/public/logo.png est permis- le modèle Autoriser est composé de 13 caractères contre Disallow' ;s 6 - tandis que /admin/secret est rejeté, car seul le motif de refus est conforme. C'est le mécanisme derrière chaque "blocage du répertoire, autorise un fichier à l'intérieur", y compris WordPress admin-ajax.php Exclusion. C'est aussi pourquoi l'écriture de règles descendantes comme une configuration de pare-feu produit de mauvaises intuitions : il n'y a pas de gains de première correspondance, pas de chute et pas de commande.
Wildcards et l'ancre finale
Deux caractères spéciaux sont pris en charge dans les modèles de chemin.
* Correspond à n'importe quelle séquence de caractères, y compris aucun. Disallow: /*?sessionid= Bloque toute URL contenant ce paramètre de requête n'importe où.
$ Ancre la fin de l'URL et signifie uniquement que lorsqu'il s'agit du caractère final du motif. Disallow: /*.pdf$ blocs /whitepaper.pdf mais pas /whitepaper.pdf?download=1, parce que cette URL ne s'arrête pas à .pdf. Laisse tomber le $ et vous bloquez les deux - ainsi que tout ce que le chemin contient simplement .pdf.
sans $, la correspondance est un correspondance préfixe, qui fait trébucher les gens constamment. Disallow: /admin blocs /admin, /admin/, /admin/users, et aussi /administrator et /admin-tools, parce que tous commencent par la chaîne /admin. Si vous ne vouliez dire que le répertoire, écrivez /admin/.
Le retard de crawl n'est pas universellement honoré
Crawl-delay: 10 Demande à un crawler d'attendre dix secondes entre les demandes. Bing, Yandex et divers petits robots honorent. Googlebot l'ignore complètement- Google ajuste le taux d'exploration en fonction des temps de réponse du serveur et du paramètre dans la console de recherche, et non d'une directive de votre fichier. Définir un délai d'exploration important sur un grand site est une arme à pied au ralenti : à 10 secondes par demande, un site de 100 000 pages prend près de douze jours pour explorer une fois, et en pratique, une grande partie n'est jamais explorée. Si l'exploration lance véritablement votre serveur, réparez le serveur ou mettez en cache les pages ; limiter le robot d'exploration vous rend pour la plupart invisible.
Bloquer les robots d'exploration d'IA
Les robots d'IA se divisent en deux catégories que les gens confondent régulièrement Les robots d'entraînement - GPTBot, ClaudeBot, CCBot, Bytespider, Google-Extended - rassemblent le contenu utilisé pour former les modèles d'exploration de moteurs de réponses, dont PerplexityBot est l'exemple le plus clair, récupèrent les pages afin qu'elles puissent être citées dans les réponses générées, ce qui peut vous envoyer du trafic de référence Le blocage de la première catégorie protège votre contenu d'être absorbé dans un modèle ; le blocage de la seconde vous retire d'une surface où vous pourriez autrement être cité.
Google-Extended mérite une note spécifique car son nom est trompe. Ce n'est pas un robot d'exploration. Il s'agit d'un jeton qui contrôle si le contenu déjà récupéré par Googlebot peut être utilisé pour la formation Gemini et Vertex AI. L'interdire a Aucun effet Dans le cadre de la recherche Google, l'indexation ou le classement. Vous pouvez refuser l'utilisation de l'IA de Google et conserver votre présence de recherche entièrement intacte.
Et la mise en garde qui s'applique à chacun d'eux : la conformité est volontaire. Le blocage de GPTBOT arrête le robot d'exploration déclaré d'OpenAi, car OpenAI choisit d'honorer le fichier. Il ne fait rien sur un scraper qui ment sur son agent d'utilisateur, et il n'y a pas de directive robots.txt qui le peut.
Référence directive
| directeur | étendue | intention | honoré par |
|---|---|---|---|
User-agent: |
Ouvre un groupe | Nommer le ou les robots d'exploration auxquels les règles suivantes s'appliquent. * est le fourre-tout. |
chacun |
Disallow: |
au sein d'un groupe | Demande au robot de lecture de ne pas récupérer les URL correspondant au chemin. un nu Disallow: Sans valeur, c'est "autoriser tout". |
chacun |
Allow: |
au sein d'un groupe | s'il est stipulé une exception à un plus large Disallow. Gagne des égalités par match le plus long. |
Google, Bing, les robots d'exploration les plus modernes |
Crawl-delay: |
au sein d'un groupe | Minimum de secondes entre les demandes. | Bing, Yandex, autres - pas googlebot |
Sitemap: |
global | URL absolue d'un sitemap ou d'un index de plan de site. S'applique à tous les robots d'exploration, quel que soit le placement. | Google, Bing, la plupart des robots d'exploration |
Host: |
global | Miroir/domaine préféré. Une extension Yandex. | Yandex uniquement |
Noindex: |
- | ne fonctionne pas. Google a abandonné le support en 2019. utiliser un noindex balise méta ou X-Robots-Tag en-tête. |
personne |
# |
n'importe où | Commentaire. Tout ce qui suit sur la ligne est ignoré. | chacun |
Cas d'utilisation courants
Garder la malbouffe hors de l'index sans bloquer quoi que ce soit d'important
Le travail de pain et de beurre : bloquer les URL de recherche facettes, les chaînes de requête de session-ID, les résultats de recherche internes et les pages de panier ou de paiement afin que les robots d'exploration dépensent leur budget sur des pages qui peuvent réellement se classer. Le piège est trop bloquant. Une règle comme Disallow: /*? Bloque chaque URL avec une chaîne de requête, qui sur de nombreux sites comprend des pages de catégorie paginées dont vous souhaitez vraiment être analysées. Testez les modèles avant de les expédier.
Prendre un site de mise en scène sombre
User-agent: * plus Disallow: / est le bon appel pour un environnement de mise en scène ou de prévisualisation, et le Block tout ce qui est préréglé le produit Mais traitez cela comme une hygiène, pas une sécurité : les environnements de mise en scène devraient également être derrière HTTP auth ou une liste d'autorisation IP, car robots.txt ne cache ni n'empêche personne de le parcourir Et le fichier ne doit jamais, jamais être promu en production - mettez-le dans le pipeline de déploiement' ; avis diff, car cette erreur exacte est la manière la plus courante de disparaître des sites de Google.
Réparation d'un site qui a abandonné la recherche
Lorsque le trafic organique tombe d'une falaise, /robots.txt est la première chose à vérifier avant la mise à jour de l'algorithme et les audits de backlink. Collez le fichier en direct dans le générateur et lisez la sortie du validateur. un errant Disallow: /, une règle qui bloque le CSS et le Googlebot JavaScript pour rendre la page ou un Googlebot groupe qui remplace accidentellement un écrit soigneusement * Le groupe apparaîtra immédiatement.
Décider de ce que les robots d'exploration d'IA peuvent faire avec votre contenu
Les éditeurs, les sites de documentation et toute personne dont le contenu est le produit ont désormais une véritable décision à prendre concernant la formation des robots d'exploration Le préréglage des robots d'exploration Block AI vous donne une valeur par défaut défendable - les moteurs de recherche sont les bienvenus, les robots d'entraînement refusés - et la table d'exploration explique chacun d'eux afin que vous puissiez faire des exceptions délibérément, comme garder PerplexityBot autorisé pour le trafic de référence tout en refusant les robots d'entraînement purs.
Auditer un site hérité
Vous prenez le contrôle d'un site et personne ne sait pourquoi /resources/ n'est pas indexé. Importez le Live Robots.txt, exécutez le testeur sur les chemins en question et l'outil nomme la règle exacte qui le fait. Cela prend une minute et remplace un après-midi de devinette.
Pourquoi générer des robots.txt dans le navigateur
le Générateur robots.txt fonctionne entièrement côté client Vos chemins, noms d'hôtes et règles ne quittent jamais la machine, ce qui compte plus qu'il n'y paraît - la structure de répertoire d'un produit inédit, l'URL d'un hôte de mise en scène et les itinéraires internes que vous essayez de garder silencieux valent la peine de ne pas coller dans les journaux du serveur de quelqu'un d'autre' ; Une fois la page chargée, elle fonctionne hors ligne et la sortie est un fichier texte brut que vous possédez.
Robots.txt s'inscrit dans quelques emplois voisins. le Générateur de balises produit le noindex et les balises canoniques qui font le travail robots.txt ne peuvent pas. le Ouvrir un aperçu du graphique Montre comment vos liens seront rendus une fois que les robots d'exploration que vous avez autorisés à venir les chercher. et le générateur de limace Construit les chemins propres auxquels vos règles finiront par correspondre.
FAQ
Où puis-je mettre le fichier robots.txt ?
Il doit être servi à exactement /robots.txt sur l'hôte auquel il s'applique - par exemple https://example.com/robots.txt. Les robots d'exploration ne cherchent nulle part ailleurs. un fichier à /blog/robots.txt est entièrement ignoré et le fichier sur example.com ne gouverne pas shop.example.com; chaque hôte a besoin de son propre. Servez-le avec un statut 200 et un text/plain Type de contenu.
Interdire la suppression d'une page de Google ?
Non, et c'est le malentendu le plus important à propos du format. Interdire l'arrêt Google empêche Google de récupérer une page, il ne supprime pas l'URL de l'index. Si d'autres sites sont liés à une URL bloquée, Google peut toujours la répertorier, généralement sans description car il n'a jamais lu la page. Pour garder une page hors des résultats de recherche, autorisez l'exploration et servez un noindex Balise méta de robots ou un X-Robots-Tag en-tête. Si vous bloquez l'URL, le robot d'exploration ne peut jamais voir le noindex que vous avez ajouté.
Robots.txt est-il un moyen de masquer des pages privées ?
Non. C'est un fichier public que tout le monde peut lire, et son honneur est volontaire - les grattoirs malveillants l'ignorent complètement. Inscription /internal-admin/ Dans vos règles de refus, indiquez à chaque attaquant exactement où chercher. Tout ce qui doit rester privé a besoin d'authentification, une liste d'autorisation IP ou de ne pas être du tout sur Internet public.
Comment autoriser et interdire l'interaction lorsque les deux correspondent à une URL ?
La règle la plus spécifique gagne, lorsque la spécificité signifie la longueur du modèle de trajectoire. donné Disallow: /admin et Allow: /admin/public, l'URL /admin/public est autorisée car le modèle d'autorisation est plus long, tandis que /admin/secret est bloqué. Si deux modèles ont exactement la même longueur, autorisez les gains. Les règles de commande apparaissent dans le fichier, ce qui surprend les personnes qui attendent un comportement de premier match de pare-feu.
Que font les caractères génériques * et $ ?
Un astérisque correspond à n'importe quel nombre de caractères, donc Disallow: /*?sessionid= Bloque toute URL contenant ce paramètre. Un signe dollar ancre la fin de l'URL, donc Disallow: /*.pdf$ blocs /report.pdf mais pas /report.pdf?download=1. sans $, la correspondance est une correspondance de préfixe : Disallow: /admin blocs /admin, /admin/users, et aussi /administrator, parce que tous commencent par cette chaîne.
Comment bloquer les robots d'exploration d'IA comme GPTBOT et Claudebot ?
Donnez à chacun son propre groupe avec Disallow: /. Le préréglage Block AI Crawlers le fait pour GPTBot, Claudebot, PerplexityBot, CCBot, Google-Extended, ByTespider et Anthropic-AI en un seul clic tout en laissant Googlebot et Bingbot libres d'explorer. Notez que Google-Extended ne contrôle que l'utilisation de l'entraînement pour Gemini et Vertex AI et n'a aucun effet sur la recherche Google. La conformité est volontaire, ce qui empêche les robots d'exploration de coopération, non les racleurs non déterminés.
Le délai de crawl fonctionne-t-il réellement ?
Cela dépend du robot d'exploration. Googlebot l'ignore complètement : le taux d'exploration est ajusté à partir de la console de recherche et de votre serveur et des temps de réponse n°39. Bing, Yandex et plusieurs robots d'exploration plus petits l'honorent, traitant la valeur comme le nombre minimum de secondes entre les requêtes. Définir un délai important sur un grand site peut signifier que la plupart des pages ne sont jamais explorées du tout, alors gardez les valeurs petites et corrigez la capacité du serveur si l'exploration est véritablement un problème.
Que se passe-t-il si mon robots.txt a une erreur de syntaxe ?
Les robots d'exploration écartent silencieusement les lignes qu'ils ne peuvent pas analyser et continuer avec le reste, de sorte qu'une règle enfreinte échoue silencieusement plutôt qu' bruyamment. une directive inconnue, un chemin manquant sa barre oblique ou une règle placée au-dessus du premier User-agent: Line ne fait rien, et vous ne le saurez pas tant que votre trafic n'aura pas bougé. C'est exactement à cela que sert le validateur : il signale chacun d'entre eux avec un numéro de ligne avant de déployer.



