Die teuersten vier Charaktere, die ich je gesehen habe, waren Disallow: /drohen Ein Team hat während einer Veröffentlichung einen Staging-Roboter.txt in die Produktion gebracht, und in den folgenden zehn Tagen hat Google die meisten Seiten der Website leise gelöscht. Der Verkehr stürzte nicht so ab, dass Alarme ausgelöst wurden, sondern erschöpfte. Zu der Zeit dachte jemand daran zu überprüfen /robots.txtDie Erholung war ein Monat des erneuten Krabbelns. Die Datei, die es verursachte, war vier Zeilen lang.
Robots.txt ist täuschend einfach Es ist Klartext, es hat vielleicht sechs wissenswerte Direktiven, und die Syntax passt auf eine Karteikarte, genau diese Einfachheit ist der Grund, warum es schief geht: Es gibt keinen Build-Schritt, keinen Linter in Ihrem CI, kein Typsystem, und keine Fehlermeldung Wenn Sie eine Regel schreiben, die ein Crawler nicht analysieren kann, ignoriert der Crawler stillschweigend diese Zeile und macht weiter Ihre Datei sieht gut aus, Ihre Website sieht gut aus, und etwas, von dem Sie dachten, dass es blockiert war, wird gecrawlt - oder etwas, das Sie gecrawlt haben, ist es nicht.
Ich baue Toolz.dev Und ich schreibe ständig robots.txt-Dateien für Staging-Umgebungen, Kundenseiten und meine eigenen Projekte, also habe ich die robots.txt-Generator um die Fehlermodi sichtbar zu machen. Es baut die Datei aus einer strukturierten Form auf, sodass die Syntax durch Konstruktion richtig ist. Es fließt das, was Sie geschrieben haben, und ruft die Fußwaffen mit Leitungsnummern. Und es testet eine URL gegen Ihre Regeln mit der gleichen Verwendung von Real-Crawlern mit der höchsten Übereinstimmung, die Sie vor der Bereitstellung erreichen können, anstatt dass die Search Console Ihnen mitteilt, dass dies nicht der Fall ist.
tl; dr: Robots.txt sagt Crawlern, was sie abrufen können Es entfernt keine Seiten aus den Suchergebnissen, und es schützt nichts Privates - die Datei ist öffentlich, und die Einhaltung ist freiwillig Regeln gelten nur innerhalb eines
User-agent:Gruppe, Pfade müssen mit beginnen/,*Passt zu allem, ein Nachlauf$Verankert das Ende, und wenn zwei Regeln übereinstimmen, gewinnt das längste Muster mit den zulässigen Bindungen. der robots.txt-Generator Erstellt, fusselt und testet all das in Ihrem Browser.
Was Robots.txt tatsächlich steuert
Robots.txt ist eine Crawl-Direktive, keine Index-Direktive. Diese einzige Unterscheidung erklärt den größten Teil der Verwirrung um ihn herum.
Wenn ein Crawler eine URL auf Ihrem Host abrufen möchte, holt er zuerst https://yourhost/robots.txt und prüft, ob die URL zulässig ist. Wenn a Disallow Regelübereinstimmungen, ein gut erzogener Crawler fordert die Seite nicht an. Das ist der gesamte Mechanismus. Es regelt die HTTP-Anfrage und nichts anderes.
Was es nicht tut, ist eine URL aus dem Suchindex zu entfernen. Google kann und erstellt URLs, die es noch nie abgerufen hat, und verwendet nur den Ankertext und den Kontext von Links, die darauf weisen. Wenn Sie blockieren /pricing in robots.txt und fünfzig Websites verlinken /pricingGoogle zeigt diese URL möglicherweise immer noch in den Ergebnissen an - normalerweise ohne Beschreibung, da die Seite nie gelesen wird. Das Blockieren einer von der Suche gewünschten URL wirkt sich aktiv gegen Sie aus: Die noindex Tag, das es entfernt, lebt auf der Seite, und ein Crawler, der die Seite nicht abrufen darf, kann sie nie sehen. Die richtige Reihenfolge ist das Crawlen, dienen <meta name="robots" content="noindex"> oder ein X-Robots-Tag: noindex Warten Sie, bis die Seite ausfällt, und blockieren Sie sie erst dann, wenn Sie das Crawler-Budget sparen möchten.
Es schützt auch nichts. Robots.txt wird öffentlich auf einem bekannten Pfad bedient, jeder, einschließlich aller Angreifer im Internet, kann Ihren Browser in einem Browser lesen. ein Disallow: /internal-admin-v2/ Linie ist ein Wegweiser, der auf das Ding zeigt, das Sie versteckt haben wollten Bösartige Schaber ignorieren die Datei völlig - es zu ehren ist eine freiwillige Konvention, kein Durchsetzungsmechanismus Alles, was privat sein muss, braucht Authentifizierung oder eine IP-Genehmigungsliste Robots.txt ist eine höflich gemachte Anfrage an Crawler, die sich dafür entscheiden, zuzuhören.
Hauptmerkmale des robots.txt-Generators
Strukturierter Gruppeneditor
Die Grammatik der Datei ist Gruppen: eine oder mehrere User-agent: Zeilen gefolgt von den Regeln, die für sie gelten. Das Schreiben von Hand lädt den häufigsten strukturellen Fehler ein, der über dem ersten schwebt User-agent: Linie, wo es auf niemanden zutrifft. Der Generator baut Gruppen als erstklassige Objekte auf, sodass jede von Ihnen hinzugefügte Regel notwendigerweise zu einer Gruppe gehört.
Ein Validator, der die echten Fußwaffen meldet
Der Linter läuft auf jedem Tastendruck und meldet Fehler, Warnungen und Notizen mit Zeilennummern. Es markiert Regeln außerhalb jeder Gruppe, Pfade, die ihren führenden Schrägstrich verfehlen, eine bloße Disallow: ohne Wert (was "alles zulassen" bedeutet und fast nie das ist, was der Autor gemeint hat), Sitemap-URLs, die nicht absolut sind, $ Wird überall verwendet, außer am Ende eines Musters, unbekannten Anweisungen, doppelten Benutzer-Agenten-Gruppen und - laut - a Disallow: / Sitzen unter User-agent: *drohen
Ein echter URL-Tester
Geben Sie einen Pfad und einen Benutzer-Agenten ein und das Tool meldet Zulässig oder Nicht zulässig, plus die genaue Regel, die es entschieden hat Die Präzedenzlogik ist die echte von RFC 9309: Das längste passende Pfadmuster gewinnt unabhängig von den in der Datei angezeigten Bestellregeln, und wenn zwei Muster gleich lang sind, können Beats zulassen nicht zulassen Dies ist der Teil, den Menschen am häufigsten in der Intuition falsch machen, da er sich nicht wie eine Firewall verhält. & #39;s Regeln für den ersten Matchsieg.
Ein-Klick-Voreinstellungen
Erlaube alles, blockiere alles, blockiere alles, speichere WordPress, Shopify, Next.js und Block-AI-Crawler füllen das gesamte Formular mit einem korrekten, vernünftigen Ausgangspunkt aus. Die WordPress-Voreinstellungen blockiert /wp-admin/ Beim Ausschnitzen /wp-admin/admin-ajax.php, die viele handgeschriebene Dateien vergessen und dadurch die Front-End-Funktionalität brechen, die Google benötigt, um die Seite zu rendern.
AI-Crawler-Steuerelemente
Ein Klick fügt Ablehnungsgruppen für GPTBot, Claudebot, PerplexityBot, CCBot, Google-Extended, ByteSpider und Anthropic-AI hinzu, während GoogleBot und Bingbot frei kriechen können. Die bekannte Crawler-Tabelle erklärt, was jeder Bot tatsächlich tut. Sie treffen also eine informierte Wahl, anstatt eine Liste aus einem Blog-Beitrag einzufügen.
Analysiert Ihre vorhandene Datei
Fügen Sie die Roboter ein.txt, die Sie bereits bedienen, und das Tool liest sie in bearbeitbare Gruppen zurück. Die meisten Roboter.txt-Arbeiten sind keine grüne Wiese - es handelt sich um die Prüfung und Reparatur von etwas, das vor drei Jahren von jemandem geschrieben wurde, der gegangen ist - und ausgehend von dem, was tatsächlich live ist, ist das einzig vernünftige Mittel dazu.
Alles bleibt in Ihrem Browser
Die Datei wird in clientseitiger JavaScript generiert, flink und getestet. Es wird nichts hochgeladen, sodass Sie sicher Regeln für einen Staging-Host oder einen unangekündigten Abschnitt einer Website erstellen können. Das Tool funktioniert nach dem Laden offline.
So verwenden Sie den robots.txt-Generator
Schritt 1: Starten Sie von einem Preset oder importieren Sie, was Sie bereits haben
Wenn Sie neu anfangen, wählen Sie die Voreinstellung, die Ihrem Stapel am nächsten liegt. Wenn Sie bereits einen robots.txt bedienen, holen Sie ihn ab https://yoursite.com/robots.txt, fügen Sie es in das Feld Import ein und klicken Sie auf "In Gruppen analysieren". Das Tool rekonstruiert die Gruppenstruktur und der Validator sagt Ihnen sofort, was mit der Datei, die Sie in der Produktion ausgeführt haben, nicht stimmt.
Schritt 2: Erstellen Sie Ihre Benutzeragentengruppen
Jede Gruppe zielt auf einen oder mehrere Crawler ab. Fügen Sie Crawler aus der Liste bekannter Bots hinzu oder geben Sie direkt ein Token ein - Token werden fallunsensibel abgeglichen, also googlebot und Googlebot sind gleichwertig. Eine Gruppe mit * ist das Sammeln: Es gilt für jeden Crawler, der keine spezifischere Gruppe für sich hat.
Das Entscheidende hier zu verinnerlichen ist, dass Crawler genau einer Gruppe gehorchen. Googlebot liest die Googlebot Gruppe, wenn man existiert und ignoriert die * Gruppe ganz - es führt sie nicht zusammen Wenn Sie eine Googlebot Gruppe Um eine Regel hinzuzufügen, müssen Sie jede Regel aus der * Gruppe darin, oder Googlebot hört stillschweigend auf, ihnen zu gehorchen. Das überrascht fast alle beim ersten Mal.
Schritt 3: Fügen Sie Regeln, Sitemaps hinzu und lesen Sie den Validator
Fügen Sie Pfadverbote für das hinzu, was Crawler überspringen sollen, und erlauben Sie Pfade für die Carve-Outs darin. Fügen Sie eine Crawl-Verzögerung nur hinzu, wenn Sie eine Engine anvisieren, die eine ehrt. Fügen Sie Ihre Sitemap-URLs hinzu - diese müssen absolut sein, einschließlich Schema und Host, und sie sitzen außerhalb jeder Gruppe und gelten für alle.
Dann lesen Sie den Validator. Fehler sind Dinge, die nicht funktionieren. Warnungen sind Dinge, die wahrscheinlich nicht das bedeuten, was Sie denken. Notizen sind Chancen. Repariere alles rot, bevor du weiter gehst.
Schritt 4: Testen Sie die URLs, die Ihnen wirklich wichtig sind
Dies ist der Schritt, den die Leute überspringen und nicht sollten Nehmen Sie die drei oder vier Pfade, auf deren Crawl-Status es wirklich ankommt - Ihre Produktseiten, Ihr Blog, die Admin-Route, die Sie Ihrer Meinung nach blockiert haben, die CSS-Datei, die Google benötigt, um Ihr Layout zu rendern - und testen Sie jeden einzelnen mit Googlebot Das Tool sagt Ihnen erlaubt oder nicht erlaubt und nennt die verantwortliche Regel. Wenn Sie ein Ergebnis überrascht, sagen Ihre Regeln nicht aus, was Sie denken, und es ist weitaus günstiger, das jetzt zu lernen.
Schritt 5: Kopieren oder Herunterladen und Bereitstellen im Root
Kopieren Sie die Datei oder laden Sie sie herunter robots.txt, dann genau servieren https://yourhost/robots.txt Mit einem 200 Status und a text/plain Inhaltstyp. Nirgendwo sonst funktioniert. /blog/robots.txt wird von niemandem gelesen.
Das Ausschlussprotokoll der Roboter im Detail
Es ist endlich ein Standard
Für 25 Jahre war Robots.txt eine Konvention, die in einem Mailinglistenpost von 1994 beschrieben wurde, und Crawler interpretierten die Unklarheiten jeweils auf ihre eigene Art und Weise. 2022 erschien es als RFC 9309, die die Parsing-Regeln, die Matching-Semantik und die Rangfolge kodiert, auf der Google, Bing und die seriösesten Crawler zusammengekommen waren. Wenn in diesem Handbuch " steht, lautet die Regel X" bedeutet es, dass RFC 9309 X sagt - nicht, dass ein Blogbeitrag es behauptet.
Gruppen, und warum Crawler nur einem gehorchen
Ein Datensatz besteht aus einem oder mehreren aufeinanderfolgenden User-agent: Zeilen gefolgt von den für sie geltenden Regelzeilen Ein Crawler identifiziert sich mit einem Produkt-Token - Googlebot, Bingbot, GPTBot- und sucht die Gruppe, deren Token am spezifischsten passt Es gehorcht dieser einen Gruppe und keiner anderen Die * Gruppe ist der Fallback, der nur verwendet wird, wenn nichts spezifischer übereinstimmt.
Die praktische Konsequenz wird wiederholt, weil es so viel Schaden verursacht: Gruppen erben nicht. eine Datei, die liest
User-agent: *
Disallow: /admin/
Disallow: /cart
User-agent: Googlebot
Disallow: /internal/
bedeutet, dass Googlebot möglicherweise kriecht /admin/ und /cart frei. Es hat eine eigene Gruppe gefunden, also die * Gruppe ist dafür unsichtbar. Wenn Sie möchten, dass Googlebot von allen drei blockiert wird, müssen alle drei Regeln innerhalb der Googlebot Gruppe
Vorrang vor der längsten Übereinstimmung
Wenn zwei oder mehr Regeln in der zutreffenden Gruppe einer URL entsprechen, ist der Gewinner derjenige mit dem längstes Pfadmuster, gemessen in Zeichen. Die Reihenfolge in der Datei ist unerheblich. Wenn die längste Übereinstimmung zulässig und die längste Übereinstimmung nicht zulässig sind, lassen Sie Gewinne zu.
User-agent: *
Disallow: /admin
Allow: /admin/public
Unter diesen Regeln, /admin/public/logo.png ist erlaubt- das Muster Zulassen ist 13 Zeichen gegen die Disallow's 6 - während /admin/secret ist ungültig, weil nur das Disallow-Muster damit übereinstimmt. Dies ist der Mechanismus hinter jedem "Blockieren des Verzeichnisses, erlauben Sie eine Datei darin" - Muster, einschließlich WordPress admin-ajax.php Carve-out. Es ist auch der Grund, warum das Schreiben von Regeln wie eine Firewall-Konfiguration falsche Intuitionen erzeugt: Es gibt keine ersten Gewinne, keinen Durchfall und keine Bestellung.
Wildcards und der Endanker
Zwei Sonderzeichen werden in Pfadmustern unterstützt.
* Entspricht einer beliebigen Zeichenfolge, einschließlich keine. Disallow: /*?sessionid= Blockiert jede URL, die diesen Abfrageparameter enthält.
$ Verankert das Ende der URL und bedeutet nur, dass es der endgültige Charakter des Musters ist. Disallow: /*.pdf$ Blöcke /whitepaper.pdf Aber nicht /whitepaper.pdf?download=1, weil diese URL nicht endet .pdfdrohen Lass das fallen $ Und Sie blockieren beides - zusammen mit allem anderen, dessen Weg lediglich enthält .pdfdrohen
Ohne $, Matching ist ein Präfix übereinstimmen, die Menschen ständig stolpert. Disallow: /admin Blöcke /admin, /admin/, /admin/users, und auch /administrator und /admin-tools, weil alle mit der Zeichenfolge beginnen /admindrohen Wenn Sie nur das Verzeichnis gemeint haben, schreiben Sie /admin/drohen
Crawl-Delay wird nicht allgemein geehrt
Crawl-delay: 10 Bittet einen Crawler, zwischen den Anforderungen zehn Sekunden zu warten. Bing, Yandex und verschiedene kleinere Crawler ehren es. Googlebot ignoriert es vollständig- Google passt die Crawl-Rate basierend auf den Reaktionszeiten des Servers und der Einstellung in der Search Console an, nicht auf einer Anweisung in Ihrer Datei. Das Festlegen einer großen Crawl-Verzögerung auf einer großen Website ist eine Zeitlupen-Fußwaffe: Bei 10 Sekunden pro Anfrage dauert das Crawlen einer 100.000-seitigen Website einmal fast zwölf Tage, und in der Praxis wird vieles davon überhaupt nicht gecrawlt. Wenn Crawling Ihrem Server wirklich schadet, reparieren Sie den Server oder legen Sie die Seiten zwischen; Durch das Drosseln des Crawlers werden Sie größtenteils nur unsichtbar.
Blockieren von KI-Crawlern
Die KI-Crawler teilen sich in zwei Kategorien auf, die die Leute routinemäßig miteinander verschmelzen Training-Crawler - GPTBot, ClaudeBot, CCBot, Bytespider, Google-Extended - sammeln Inhalte, die zum Trainieren von Modellen verwendet werden Antwort-Engine-Crawler, von denen PerplexityBot das klarste Beispiel ist, holen Seiten ab, damit sie in generierten Antworten zitiert werden können, die Ihnen Empfehlungsverkehr senden können Blockieren der ersten Kategorie schützt Ihre Inhalte davor, in ein Modell aufgenommen zu werden; Blockieren der zweiten entfernt Sie von einer Oberfläche, auf der Sie sonst zitiert werden könnten.
Google-Extended verdient eine bestimmte Notiz, weil es irregeführt wird. Es ist kein Crawler. Es ist ein Token, der steuert, ob bereits von Googlebot abgerufene Inhalte für Gemini- und Vertex-KI-Training verwendet werden können. es hat nicht zugelassen Keine Auswirkung Auf der Google-Suche crawlen, indizieren oder ranking. Sie können die Nutzung von Google-KI-Schulungen ablehnen und Ihre Suche vollständig intakt halten.
Und die Einschränkung, die für alle gilt: Compliance ist freiwillig. Das Blockieren von Gptbot stoppt den deklarierten Crawler von OpenAI, da OpenAI die Datei einrichtet. Es macht nichts über einen Scraper, der über seinen User-Agent liegt, und es gibt keine robots.txt-Direktive, die es kann.
Verweise
| Anweisung | Spielraum | Zweck | geehrt von |
|---|---|---|---|
User-agent: |
Öffnet eine Gruppe | Namen Der/die Crawler(e) Die folgenden Regeln gelten. * ist das Allerding. |
jeder |
Disallow: |
Innerhalb einer Gruppe | fordert den Crawler auf, keine URLs abzurufen, die dem Pfad entsprechen. eine bloße Disallow: ohne Wert bedeutet "Alles zulassen". |
jeder |
Allow: |
Innerhalb einer Gruppe | schnitzt eine Ausnahme aus einem breiteren Disallowdrohen Gewinnt die Bindungen nach dem längsten Spiel. |
Google, Bing, die meisten modernen Crawler |
Crawl-delay: |
Innerhalb einer Gruppe | Mindestsekunden zwischen den Anfragen. | Bing, Yandex, andere - nicht Googlebot |
Sitemap: |
global | Absolute URL eines Sitemap- oder Sitemap-Index. Gilt für alle Crawler unabhängig von der Platzierung. | Google, Bing, die meisten Crawler |
Host: |
global | Bevorzugter Spiegel/Domäne. Eine Yandex-Erweiterung. | Nur Yandex |
Noindex: |
- | funktioniert nicht. Google hat den Support 2019 fallen gelassen. Verwenden Sie a noindex Meta-Tag oder X-Robots-Tag Kopfball. |
keiner |
# |
irgendwohin | kommentieren Alles, was danach in der Linie ist, wird ignoriert. | jeder |
Häufige Anwendungsfälle
Halten Sie Junk aus dem Index, ohne etwas Wichtiges zu blockieren
Der Brot-und-Butter-Auftrag: Blockieren Sie URLs für die Facett-Suche, Abfragezeichenfolgen der Sitzungs-ID, interne Suchergebnisse und Warenkorb- oder Kassenseiten, damit Crawler ihr Budget für Seiten ausgeben, die tatsächlich rangieren können. Die Falle ist überblockiert. Eine Regel wie Disallow: /*? Blockiert jede URL mit einer Abfragezeichenfolge, die auf vielen Websites paginierte Kategorieseiten enthält, die Sie unbedingt durchsuchen möchten. Testen Sie die Muster, bevor Sie sie versenden.
Eine Staging-Site dunkel machen
User-agent: * Pluszeichen Disallow: / Ist der richtige Aufruf für eine Staging - oder Preview-Umgebung, und die Block all that preset produziert das Aber behandeln Sie dies als Hygiene, nicht als Sicherheit: Staging-Umgebungen sollten auch hinter HTTP auth oder einer IP-Adullowlist stecken, denn robots.txt versteckt weder den Host noch hält irgendjemanden davon ab, darin zu surfen Und die Datei darf niemals, niemals in Produktion gebracht werden - legen Sie sie in die Deploy-Pipeline & #39; s diff review, denn genau dieser Fehler ist die häufigste Art und Weise, wie Websites von Google verschwinden.
Reparieren einer Website, die nicht gesucht wurde
Wenn der organische Verkehr von einer Klippe fällt, /robots.txt ist das erste, was zu überprüfen ist, bevor der Algorithmus aktualisiert und die Backlink-Audits. Fügen Sie die Live-Datei in den Generator ein und lesen Sie die Validierungsausgabe. Ein Streuner Disallow: /, eine Regel, die das CSS und Javascript blockiert Googlebot benötigt, um die Seite zu rendern, oder a Googlebot Gruppe, die versehentlich eine sorgfältig geschriebene überschreibt * Gruppe wird sofort angezeigt.
Entscheiden Sie, was KI-Crawler mit Ihren Inhalten anfangen können
Verlage, Dokumentationsseiten und alle, deren Inhalt das Produkt ist, müssen jetzt eine echte Entscheidung über das Training von Crawlern treffen. Die voreingestellten Block-KI-Crawler geben Ihnen einen vertretbaren Standard - Suchmaschinen sind willkommen, das Training von Crawlern wird abgelehnt - und die Crawler-Tabelle erklärt jeden einzelnen, damit Sie bewusst Ausnahmen machen können, z. B. indem PerplexityBot den Empfehlungsverkehr zulässt und gleichzeitig die reinen Trainingsbots ablehnt.
Auditing einer geerbten Site
Sie übernehmen eine Seite und niemand weiß warum /resources/ nicht indiziert ist. Importieren Sie die Live Robots.txt, führen Sie den Tester gegen die betreffenden Pfade aus und das Tool benennt die genaue Regel, die dies tut. Dies dauert eine Minute und ersetzt einen Nachmittag des Ratens.
Warum Robots.txt im Browser generieren
der robots.txt-Generator Läuft komplett clientseitig Ihre Pfade, Hostnamen und Regeln verlassen niemals die Maschine, was wichtiger ist, als es scheinen mag - die Verzeichnisstruktur eines unveröffentlichten Produkts, die URL eines Staging-Hosts und die internen Routen, die Sie zu verschweigen versuchen, sind alles Dinge, die es wert sind, nicht in jemand anderen eingefügt zu werden's Serverprotokolle Sobald die Seite geladen ist, funktioniert sie offline und die Ausgabe ist eine reine Textdatei, die Sie besitzen.
robots.txt sitzt neben einigen Nachbarjobs. der Meta-Tag-Generator produziert das noindex und kanonische Tags, die die Arbeit robots.txt nicht ausführen können. der Graph-Vorschau öffnen Zeigt, wie Ihre Links rendern werden, sobald die Crawler, die Sie zulassen haben, kommen und sie abrufen. und das Schneckengenerator Erstellt die sauberen Pfade, mit denen Ihre Regeln übereinstimmen.
FAQ
Wo lege ich die robots.txt-Datei ab?
es muss genau serviert werden /robots.txt Auf dem Host gilt es für - zum Beispiel https://example.com/robots.txtdrohen Crawler suchen nirgendwo anders. eine Datei bei /blog/robots.txt wird vollständig ignoriert und die Datei auf example.com regiert nicht shop.example.com;; jeder Gastgeber braucht seinen eigenen. Servieren Sie es mit einem 200-Status und einem text/plain Inhaltstyp.
Entfernt eine Seite von Google nicht zu?
Nein, und dies ist das konsequenteste Missverständnis über das Format. Verhindern, dass Google eine Seite abruft, entfernt die URL nicht aus dem Index. Wenn andere Websites eine blockierte URL verlinken, kann Google diese immer noch auflisten, normalerweise ohne Beschreibung, da die Seite nie gelesen wird. Um eine Seite aus den Suchergebnissen herauszuhalten, lassen Sie das Crawlen zu und dienen Sie noindex Roboter Meta-Tag oder ein X-Robots-Tag Kopfball. Wenn Sie die URL blockieren, kann der Crawler den von Ihnen hinzugefügten Noindex nie sehen.
Ist robots.txt eine Möglichkeit, private Seiten zu verbergen?
Nein. Es ist eine öffentliche Akte, die jeder lesen kann, und ihre Einhaltung ist freiwillig - böswillige Schaber ignorieren sie völlig. Auflistung /internal-admin/ In Ihren Regeln für Nichtzulassen sagt jedem Angreifer genau, wo er suchen soll. Alles, was privat bleiben muss, braucht eine Authentifizierung, eine IP-Zulassungsliste oder ist überhaupt nicht im öffentlichen Internet.
Wie kann Interact zulassen und nicht zulassen, wenn beide einer URL entsprechen?
Die spezifischste Regel gewinnt, wobei die Spezifität die Länge des Pfadmusters bedeutet. gegeben Disallow: /admin und Allow: /admin/public, die URL /admin/public ist erlaubt, weil das erlaubte Muster länger ist, während /admin/secret ist blockiert. Wenn zwei Muster genau gleich lang sind, lassen Sie Gewinne zu. Die Bestellregeln erscheinen in der Datei, was die Leute überrascht, die das Verhalten von First-Match-Gewinn-Gewinn im Firewall-Stil erwarten.
Was machen die * und $ Wildcards?
Ein Stern passt also zu jedem Lauf von Charakteren Disallow: /*?sessionid= Blockiert jede URL, die diesen Parameter enthält. Ein Dollarzeichen verankert also das Ende der URL Disallow: /*.pdf$ Blöcke /report.pdf Aber nicht /report.pdf?download=1drohen Ohne $, Matching ist eine Präfix-Übereinstimmung: Disallow: /admin Blöcke /admin, /admin/users, und auch /administrator, weil alle mit dieser Zeichenfolge beginnen.
Wie blockiere ich KI-Crawler wie gptbot und claudebot?
Geben Sie jedem seine eigene Gruppe mit Disallow: /drohen Das Block-AI-Crawler-Preset erledigt dies für GPTBot, Claudebot, PerplexityBot, CCBot, Google-Extended, ByteSpider und Anthropic-AI in einem einzigen Klick, während Googlebot und Bingbot frei bleiben. Beachten Sie, dass Google-Extended nur die Schulung für Gemini und Vertex AI kontrolliert und keine Auswirkungen auf die Google-Suche hat. Die Einhaltung ist freiwillig, so dass die kooperativen Raupen nicht feststehen, keine bestimmten Schaber.
Funktioniert die Kriechverzögerung tatsächlich?
Es hängt vom Crawler ab. Googlebot ignoriert es vollständig - die Crawl-Rate wird von der Search Console und von Ihrem Server angepasst.'s-Antwortzeiten. Bing, Yandex und mehrere kleinere Crawler halten es jedoch ein und behandeln den Wert als die Mindestanzahl von Sekunden zwischen Anfragen. Das Festlegen einer großen Verzögerung auf einer großen Website kann dazu führen, dass die meisten Seiten überhaupt nicht gecrawlt werden. Halten Sie die Werte also klein und reparieren Sie stattdessen die Serverkapazität, wenn das Crawlen wirklich ein Problem darstellt.
Was passiert, wenn mein robots.txt einen Syntaxfehler hat?
Crawler verwerfen stillschweigend Linien, die sie nicht analysieren und mit dem Rest fortfahren können, so dass eine gebrochene Regel leise und nicht laut scheitert. Eine unbekannte Direktive, ein Pfad fehlt der führende Schrägstrich oder eine Regel, die über dem ersten platziert wird User-agent: Line tut einfach nichts und Sie werden es erst herausfinden, wenn sich Ihr Verkehr bewegt. Genau dafür ist der Validator gedacht: Er meldet diese vor der Bereitstellung mit einer Zeilennummer.



