Command Palette

Search for a command to run...

RO

Robots.txt-generator

Bouw, valideer en test een robots.txt-bestand - gebruikers-agentgroepen, toestaan/niet toestaan regels, sitemaps, AI-crawlerblokkering en een live URL-tester

Presets:

User-agent group 1

Crawlers
*
Disallow
Allow

User-agent group 2

Crawlers
GPTBotClaudeBotCCBot
Disallow
Allow
Sitemap URLs

robots.txt

User-agent: *
Disallow: /admin/
Disallow: /cart
Disallow: /*?sessionid=
Allow: /admin/public/

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

Upload this to the root of your domain so it is served at /robots.txt.

Validation

0 errors · 1 warning
  • Line 10: `Disallow: /` blocks the whole site for "GPTBot, ClaudeBot, CCBot". That is intentional when refusing a specific crawler - just confirm it is the agent you meant.

Test a URL

Allowed - `Allow: /admin/public/` in the "*" group is the longest matching rule for /admin/public/style.css, so it is crawlable.

The longest matching path pattern wins, and Allow beats Disallow on a tie - the same precedence real crawlers use.

Known crawlers

Click Block to add a group that refuses a crawler outright. Compliance is voluntary - this stops cooperative bots, not scrapers.

TokenWhat it isAction
GooglebotGoogle Search's main web crawler. Blocking it removes you from Google over time.
Googlebot-ImageCrawls images for Google Images. Block it to keep photos out of image search.
BingbotMicrosoft Bing's crawler. Also feeds Bing-powered results in other products.
DuckDuckBotDuckDuckGo's own crawler for its instant answers and index.
BaiduspiderBaidu's crawler, the dominant search engine in China.
YandexBotYandex's crawler, the leading search engine in Russia.
SlurpYahoo's legacy crawler. Still used for some Yahoo verticals.
ApplebotApple's crawler, powering Siri and Spotlight Suggestions.
TwitterbotFetches link preview cards for X/Twitter. Blocking it kills your share previews.
facebookexternalhitFetches Open Graph previews for Facebook, Messenger, and WhatsApp.
GPTBotAIOpenAI's crawler that collects public web content used to train its models.
ClaudeBotAIAnthropic's crawler for gathering training data for Claude.
PerplexityBotAIPerplexity's crawler, used to index pages its answer engine cites.
CCBotAICommon Crawl's bot. Its public corpus is a common source of AI training data.
Google-ExtendedAIControls whether Google may use your content for Gemini and Vertex AI training. It does not affect Google Search ranking or indexing.
BytespiderAIByteDance's crawler, associated with TikTok and its AI products.
anthropic-aiAILegacy Anthropic token. Harmless to keep alongside ClaudeBot for older references.
Category:seo
Mode:Offline
Version:1.0.0
Access:Free

Wat is een robots.txt-generator?

Robots.txt Generator interface on Toolz.dev - Build, validate, and test a robots.txt file - user-agent groups, allow/disallow rules, sitemaps, AI crawler blocking, and a live URL tester

Een robots.txt-generator bouwt het bestand met platte tekst dat zich aan de root van uw domein bevindt en vertelt crawlers welke delen van uw site ze kunnen ophalen. Het formaat ziet er eenvoudig uit - een `user-agent:`-regel gevolgd door `toestaan:` en `disallow:` regels - maar de details bijten: regels zijn alleen van toepassing binnen een groep, paden moeten beginnen met een slash, `*` en `$` gedragen zich op specifieke manieren, en een enkele zwerf `disallow: /` onder `user-agent: *` kan een hele site uit google halen. Deze tool bouwt het bestand op van een gestructureerd formulier, zodat de syntaxis correct is door constructie.

Het doet drie banen buiten de generatie. Het lint je bestand en markeert de echte voetgeweren: regels die buiten elke groep zweven, relatieve paden, een kale `disallow:` die stil betekent "allow alles toe", sitemap-URL's die geen absolute, onbekende richtlijnen en algemene blokken zijn. Het parseert een bestaande robots.txt terug in bewerkbare groepen, zodat u kunt plakken wat er vandaag live is en het repareren. En het test een URL tegen uw regels met dezelfde prioriteit die echte crawlers gebruiken - de meest specifieke wint voor matching, en laat beats toestaan dat u geen banden toestaat - zodat u kunt bewijzen dat een pagina bereikbaar is voordat u implementeert.

Eén ding dat het waard is om duidelijk te zeggen: robots.txt controleert crawlt, niet indexeren, en het is geen beveiligingsgrens. Een geblokkeerde URL kan nog steeds in de zoekresultaten verschijnen als andere pagina's ernaar linken, omdat Google een URL kan indexeren die nooit is opgehaald. Om een pagina uit de index te houden, hebt u een `noindex` metatag of een x-robots-tag-header nodig - die de crawler alleen kan zien als hij de pagina mag ophalen. En het bestand is openbaar: iedereen kan de jouwe lezen op /robots.txt, dus het vermelden van een geheime map daar adverteert het. Gebruik authenticatie voor alles wat privé is.

Hoe gebruik je de robots.txt-generator?

1

Begin vanaf een voorinstelling of plak uw huidige bestand

Kies een voorinstelling - Allow all, Block Everything, WordPress, Shopify, Next.js of Blokkeer AI-crawlers - om het formulier in één klik in te vullen, of plak je live robots.txt en laat het gereedschap het weer in bewerkbare groepen parseren.

2

Bouw uw gebruikers-agent-groepen

Voeg een groep per crawler of set crawlers toe, kies uit de lijst met bekende bots of typ een token. Geef elke groep zijn afwijking en sta paden toe, en een crawl-vertraging als de motor waarop u zich richt, er een eer aan doet.

3

Voeg sitemaps toe en lees de validator

Voeg een of meer absolute sitemap-URL's toe. De validator draait op elke toetsaanslag en meldt fouten, waarschuwingen en notities met regelnummers - repareer alles wat rood is voordat u wordt verzonden.

4

Test een URL en kopieer of download

Voer een pad en een user-agent in om toegestane of afgekeurde te zien en welke regel het precies heeft besloten. Wanneer het zich gedraagt zoals u verwacht, kopieert u het bestand of downloadt Robots.txt en uploadt het naar uw domeinroot.

Belangrijkste kenmerken

URL-tester met echt langst match

Test elk pad tegen een gebruiker-agent met behulp van RFC 9309 voorrang - de langste overeenkomende patroon wint, breekt banden toe - en benoemt de exacte regel die het heeft besloten

Ingebouwde validator

Vangt regels buiten een groep, relatieve paden, lege lijnen, niet-absolute sitemap-URL's, onbekende richtlijnen en een algemene niet-toestemming: / dat zou uw site deindexeren

Presets met één klik

Alles toestaan, alles blokkeren, WordPress, Shopify, Next.js en blokkeer AI-crawlers vullen elk het hele formulier met een verstandig, correct startpunt

AI-crawlerbedieningen

Block GPTBOT, Claudebot, PerplexityBot, CCBOT, Google-extended, bytespider en antropic-AI in één klik terwijl zoekmachines volledig welkom zijn

Frequently Asked Questions

Het moet leven in de root van de host waarop het van toepassing is, geserveerd op precies /robots.txt - bijvoorbeeld https://example.com/robots.txt. Crawlers kijken nergens anders. Een bestand op /blog/robots.txt wordt genegeerd, en robots.txt op example.com regelt geen shop.example.com of de http://-versie als u er een host, elk host en schema heeft zijn eigen bestand nodig. Dien het als tekst/gewoon met een 200 status.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!

robots.txt generatorrobots.txt file generatorfree robots.txt generatorrobots.txt generator freerobots.txt testerblock ai crawlersdisallow googlebotrobots txt validatorcrawl delayuser-agent directiveseo crawl controlblock gptbotsitemap directive