User-agent: * Disallow: /admin/ Disallow: /cart Disallow: /*?sessionid= Allow: /admin/public/ User-agent: GPTBot User-agent: ClaudeBot User-agent: CCBot Disallow: / Sitemap: https://example.com/sitemap.xml
Upload this to the root of your domain so it is served at /robots.txt.
The longest matching path pattern wins, and Allow beats Disallow on a tie - the same precedence real crawlers use.
Click Block to add a group that refuses a crawler outright. Compliance is voluntary - this stops cooperative bots, not scrapers.
| Token | What it is | Action |
|---|---|---|
| Googlebot | Google Search's main web crawler. Blocking it removes you from Google over time. | |
| Googlebot-Image | Crawls images for Google Images. Block it to keep photos out of image search. | |
| Bingbot | Microsoft Bing's crawler. Also feeds Bing-powered results in other products. | |
| DuckDuckBot | DuckDuckGo's own crawler for its instant answers and index. | |
| Baiduspider | Baidu's crawler, the dominant search engine in China. | |
| YandexBot | Yandex's crawler, the leading search engine in Russia. | |
| Slurp | Yahoo's legacy crawler. Still used for some Yahoo verticals. | |
| Applebot | Apple's crawler, powering Siri and Spotlight Suggestions. | |
| Twitterbot | Fetches link preview cards for X/Twitter. Blocking it kills your share previews. | |
| facebookexternalhit | Fetches Open Graph previews for Facebook, Messenger, and WhatsApp. | |
| GPTBotAI | OpenAI's crawler that collects public web content used to train its models. | |
| ClaudeBotAI | Anthropic's crawler for gathering training data for Claude. | |
| PerplexityBotAI | Perplexity's crawler, used to index pages its answer engine cites. | |
| CCBotAI | Common Crawl's bot. Its public corpus is a common source of AI training data. | |
| Google-ExtendedAI | Controls whether Google may use your content for Gemini and Vertex AI training. It does not affect Google Search ranking or indexing. | |
| BytespiderAI | ByteDance's crawler, associated with TikTok and its AI products. | |
| anthropic-aiAI | Legacy Anthropic token. Harmless to keep alongside ClaudeBot for older references. |

يقوم مولد Robots.txt بإنشاء ملف النص العادي الموجود في جذر نطاقك ويخبر زواحف الزحف بأي أجزاء من موقعك قد يجلبونها. يبدو التنسيق بسيطًا - `` وكيل المستخدم: '' سطر متبوعًا بـ `` السماح: '' و`العدو: القواعد - لكن التفاصيل تنطبق فقط داخل مجموعة ، يجب أن تبدأ المسارات بشرطة مائلة ، و`*` و`$` تتصرف بطرق محددة ، و "إلغاء السماح: /" ضمن "وكيل المستخدم: *" يمكن سحب موقع كامل من Google. تقوم هذه الأداة ببناء الملف من نموذج منظم بحيث يكون بناء الجملة صحيحًا بالبناء.
تقوم بثلاث وظائف بعد الجيل. إنه يربط ملفك ويضع علامة على البنادق الحقيقية: القواعد التي تطفو خارج أي مجموعة ، مسارات نسبية ، "لا يسمح:" يعني بصمت "السماح بكل شيء" ، وعناوين URL لخريطة الموقع التي ليست مطلقة ، ولايات غير معروفة ، وكتل بطانية. إنه يوزع ملف robots.txt الحالي في مجموعات قابلة للتحرير ، بحيث يمكنك لصق ما هو مباشر اليوم وإصلاحه. ويختبر عنوان URL مقابل القواعد الخاصة بك بنفس الأسبقية الأطول التي تستخدمها برامج الزحف الحقيقية - يفوز النمط المطابق الأكثر تحديدًا ، ويسمح للإيقاعات بعدم السماح بالعلاقات - حتى تتمكن من إثبات إمكانية الوصول إلى الصفحة قبل النشر.
شيء واحد يستحق الذكر بوضوح: يتحكم Robots.txt في الزحف وليس الفهرسة ، وهو ليس حدًا أمنيًا. لا يزال من الممكن أن يظهر عنوان URL المحظور في نتائج البحث إذا كانت الصفحات الأخرى مرتبطة به، لأن Google يمكنها فهرسة عنوان URL لم يسبق له جلبه. للحفاظ على صفحة خارج الفهرس ، تحتاج إلى علامة وصفية "noindex" أو رأس علامة X-robots - والتي لا يمكن للزاحف إلا أن يرى ما إذا كان مسموحًا لها بجلب الصفحة. والملف عام: يمكن لأي شخص قراءة ما يخصك على /robots.txt ، لذا فإن إدراج دليل سري هناك يعلن عنه. استخدم المصادقة لأي شيء خاص.
اختر إعدادًا مسبقًا - اسمح بكل شيء ، أو حظر كل شيء ، أو WordPress ، أو Shopify ، أو Next.js ، أو حظر برامج زحف الذكاء الاصطناعي - لملء النموذج بنقرة واحدة ، أو الصق الروبوتات الحية الخاصة بك ودع الأداة تحللها مرة أخرى في مجموعات قابلة للتحرير.
أضف مجموعة لكل زاحف أو مجموعة من برامج الزحف ، اختر من قائمة الروبوت المعروفة أو اكتب رمزًا مميزًا. امنح كل مجموعة عدم السماح بها واسمح بالمسارات ، وتأخير الزحف إذا كان المحرك الذي تستهدفه هو الشرف.
أضف عنوان URL مطلقًا أو أكثر. يعمل المدقق على كل ضغطة مفتاح ويبلغ عن الأخطاء والتحذيرات والملاحظات بأرقام الأسطر - قم بإصلاح أي شيء أحمر قبل الشحن.
أدخل مسارًا ووكيل مستخدم لرؤية مسموح به أو غير مسموح به والقاعدة التي قررت ذلك بالضبط. عندما تتصرف بالطريقة التي تتوقعها ، انسخ الملف أو تنزيل robots.txt وقم بتحميله إلى جذر المجال الخاص بك.
يختبر أي مسار ضد أي وكيل مستخدم باستخدام أسبقية RFC 9309 - يفوز نمط المطابقة الأطول ، ويسمح بكسر العلاقات - ويسمي القاعدة الدقيقة التي قررت ذلك
يمسك القواعد خارج المجموعة ، والمسارات النسبية ، وخطوط عدم السماح الفارغة ، وعناوين URL لخريطة الموقع غير المطلقة ، والتوجيهات غير المعروفة ، والرفض الشامل: / من شأنه أن يزيل فهرسة موقعك
اسمح لكل شيء ، وحظر كل شيء ، و WordPress ، و Shopify ، و Next.js ، وحظر زحف الذكاء الاصطناعي ، يملأ كل نموذج بجميع النموذج بنقطة بداية معقولة وصحيحة
حظر GPTBot و Claudebot و PerplexityBot و CCBot و Google-Extended و Bytespider و Anthropic-AI بنقرة واحدة مع الحفاظ على الترحيب الكامل بمحركات البحث
Free hreflang generator for multilingual and multi-region sites - build hreflang tags as HTML link tags, XML sitemap entries, or an HTTP header. Validates codes and x-default. 100% client-side.
Generate Apache .htaccess 301 and 302 redirect rules from a list of old-to-new URLs, plus force-HTTPS and www canonicalization directives, all in the browser.
Check one name across hundreds of TLDs at once. RDAP first, WHOIS fallback, and a verdict of available, taken or unknown — never a guess
Pull business listings for any search and place: name, address, category, rating, review count, phone and website, deduplicated and exportable as CSV.
0 comments
No comments yet. Be the first to share your thoughts!