User-agent: * Disallow: /admin/ Disallow: /cart Disallow: /*?sessionid= Allow: /admin/public/ User-agent: GPTBot User-agent: ClaudeBot User-agent: CCBot Disallow: / Sitemap: https://example.com/sitemap.xml
Upload this to the root of your domain so it is served at /robots.txt.
The longest matching path pattern wins, and Allow beats Disallow on a tie - the same precedence real crawlers use.
Click Block to add a group that refuses a crawler outright. Compliance is voluntary - this stops cooperative bots, not scrapers.
| Token | What it is | Action |
|---|---|---|
| Googlebot | Google Search's main web crawler. Blocking it removes you from Google over time. | |
| Googlebot-Image | Crawls images for Google Images. Block it to keep photos out of image search. | |
| Bingbot | Microsoft Bing's crawler. Also feeds Bing-powered results in other products. | |
| DuckDuckBot | DuckDuckGo's own crawler for its instant answers and index. | |
| Baiduspider | Baidu's crawler, the dominant search engine in China. | |
| YandexBot | Yandex's crawler, the leading search engine in Russia. | |
| Slurp | Yahoo's legacy crawler. Still used for some Yahoo verticals. | |
| Applebot | Apple's crawler, powering Siri and Spotlight Suggestions. | |
| Twitterbot | Fetches link preview cards for X/Twitter. Blocking it kills your share previews. | |
| facebookexternalhit | Fetches Open Graph previews for Facebook, Messenger, and WhatsApp. | |
| GPTBotAI | OpenAI's crawler that collects public web content used to train its models. | |
| ClaudeBotAI | Anthropic's crawler for gathering training data for Claude. | |
| PerplexityBotAI | Perplexity's crawler, used to index pages its answer engine cites. | |
| CCBotAI | Common Crawl's bot. Its public corpus is a common source of AI training data. | |
| Google-ExtendedAI | Controls whether Google may use your content for Gemini and Vertex AI training. It does not affect Google Search ranking or indexing. | |
| BytespiderAI | ByteDance's crawler, associated with TikTok and its AI products. | |
| anthropic-aiAI | Legacy Anthropic token. Harmless to keep alongside ClaudeBot for older references. |

מחולל robots.txt בונה את קובץ הטקסט הפשוט שיושב בשורש הדומיין שלך ומספר לסורקים אילו חלקים מהאתר שלך הם עשויים להביא. הפורמט נראה פשוט - 'סוכן-משתמש:` ואחריו `אפשר:` ו`לא לאפשר:` חוקים - אבל הפרטים ביס: כללים חלים רק בתוך קבוצה, הנתיבים חייבים להתחיל עם לוכסן, `*` ו-`$` להתנהג בדרכים ספציפיות, ו- `serly `sallow's `sery-agent: /` תחת `user-agent: *` יכול למשוך אתר שלם. כלי זה בונה את הקובץ מצורה מובנית כך שהתחביר יהיה נכון לפי בנייה.
הוא עושה שלוש עבודות מעבר לדור. זה משמיע את הקובץ שלך ומסמן את הרובים האמיתיים: כללים צפים מחוץ לכל קבוצה, נתיבים יחסיים, `אי-אפשר:` חשוף שפירושו בשקט "לאפשר הכל", כתובות אתרים של מפת אתר שאינן הנחיות מוחלטות, לא ידועות וחסימות גורפות. הוא מנתח את Robots.txt קיים בחזרה לקבוצות הניתנות לעריכה, כך שתוכל להדביק את מה ש-Live Today ולתקן אותו. והוא בודק כתובת URL מול הכללים שלך עם אותה קדימות ההתאמה הארוכה ביותר שסורקים אמיתיים משתמשים בהם - דפוס ההתאמה הספציפי ביותר מנצח, ומאפשר פעימות לא לאפשר קשרים - כך שתוכל להוכיח שדף נגיש לפני שאתה פורס.
דבר אחד שכדאי לציין בפשטות: ROBOS.TXT שולט בסריקה, לא באינדקס, וזה לא גבול אבטחה. כתובת URL חסומה עדיין יכולה להופיע בתוצאות החיפוש אם דפים אחרים מקשרים אליה, מכיוון שגוגל יכולה לאינדקס כתובת URL שמעולם לא הביאה. כדי לשמור דף מחוץ לאינדקס אתה צריך מטא תג `noindex` או כותרת x-robots-tag - שהסורק יכול לראות רק אם מותר לו להביא את הדף. והקובץ הוא ציבורי: כל אחד יכול לקרוא את שלך ב-/robots.txt, אז רישום ספרייה סודית שם מפרסם אותו. השתמש באימות לכל דבר פרטי.
בחר הגדרה מראש - אפשר הכל, חסום הכל, וורדפרס, shopify, next.js, או חסום סורקי בינה מלאכותית - למלא את הטופס בלחיצה אחת, או הדבק את הרובוטים החיים שלך.txt ותן לכלי לנתח אותו בחזרה לקבוצות הניתנות לעריכה.
הוסף קבוצה לכל סורק או קבוצת סורקים, בחר מתוך רשימת הבוטים הידועים או הקלדת אסימון. תן לכל קבוצה את הפסילה שלה ואפשר נתיבים, ועיכוב זחילה אם המנוע שאתה מכוון אליו מכבד אחד.
הוסף כתובת אתר אחת או יותר של Sitemap. המאמת פועל על כל הקשה ומדווח על שגיאות, אזהרות והערות עם מספרי שורות - תקן כל דבר אדום לפני המשלוח.
הזן נתיב וסוכן משתמש כדי לראות מותר או אסור ואיזה כלל בדיוק החליט. כאשר הוא מתנהג כפי שאתה מצפה, העתק את הקובץ או הורד את robots.txt והעלה אותו לשורש הדומיין שלך.
בודק כל נתיב מול כל סוכן משתמש המשתמש בעדיפות RFC 9309 - דפוס ההתאמה הארוך ביותר מנצח, מאפשר שובר קשרים - ומציין את הכלל המדויק שהחליט על כך
תופס כללים מחוץ לקבוצה, נתיבים יחסיים, שורות ביטול ריקות, כתובות אתרים לא מוחלטות של מפת אתר, הנחיות לא ידועות וביטול אינדקס: / זה יבטל את האינדקס של האתר שלך
אפשר הכל, חסום הכל, וורדפרס, Shopify, Next.js, וחסום סורקי בינה מלאכותית ממלאים כל אחד את כל הטופס עם נקודת התחלה הגיונית ונכונה
Block GPTBot, Claudebot, PerplexityBot, CCBot, Google-Extended, Bytespider ו-Anthropic-AI בלחיצה אחת תוך שמירה על מנועי החיפוש בברכה מלאה
Free hreflang generator for multilingual and multi-region sites - build hreflang tags as HTML link tags, XML sitemap entries, or an HTTP header. Validates codes and x-default. 100% client-side.
Generate Apache .htaccess 301 and 302 redirect rules from a list of old-to-new URLs, plus force-HTTPS and www canonicalization directives, all in the browser.
Check one name across hundreds of TLDs at once. RDAP first, WHOIS fallback, and a verdict of available, taken or unknown — never a guess
Pull business listings for any search and place: name, address, category, rating, review count, phone and website, deduplicated and exportable as CSV.
0 comments
No comments yet. Be the first to share your thoughts!