Command Palette

Search for a command to run...

מחולל Robots.txt: לבנות, לאמת, ולבדוק כללי סריקה מבלי Deindexing האתר שלך

מחולל Robots.txt: לבנות, לאמת, ולבדוק כללי סריקה מבלי Deindexing האתר שלך

T
Toolz Team
|Jul 19, 2026|21 קריאה דקות

חלק מאוסף כלי SEO

ארבעת הדמויות היקרות ביותר שראיתי שנשלחו אי פעם היו Disallow: /. צוות דחף robots.txt בימוי לייצור במהלך שחרור, אף אחד לא שם לב, ובמהלך עשרת הימים הבאים גוגל הפילה בשקט את רוב דפי האתר 's. התנועה לא התרסקה באופן שהפעיל אזעקות; זה התרוקן. עד שמישהו חשב לבדוק /robots.txt, השחזור היה חודש של זחילה מחדש הקובץ שגרם לו היה באורך ארבע שורות.

Robots.txt פשוט בצורה מטעה זה טקסט רגיל, יש לו אולי שש הנחיות שכדאי לדעת, והתחביר מתאים לכרטיס אינדקס הפשטות הזו היא בדיוק הסיבה שהיא משתבשת: אין שלב בנייה, אין לינטר בCI שלך, אין מערכת טיפוסים, ואין הודעת שגיאה אם אתה כותב כלל שסורק לא יכול לנתח, הסורק מתעלם בשקט מהשורה הזו וממשיך הקובץ שלך נראה בסדר, האתר שלך נראה בסדר, ומשהו שחשבת שנחסם נסרק - או משהו שהיית צריך לסרוק לא.

אני בונה Toolz.dev ואני כותב קבצי robots.txt עבור סביבות בימוי, אתרי לקוחות ופרויקטים משלי ללא הרף, אז בניתי את מחולל robots.txt כדי להפוך את מצבי הכשל לגלויים. זה בונה את הקובץ מטופס מובנה, כך שהתחביר נכון לפי בנייה. זה ממצה את מה שכתבת וקורא לרובי הרגליים עם מספרי שורות. והוא בודק כתובת URL מול הכללים שלך באמצעות אותה עדיפות התאמה ארוכה ביותר שסורקים אמיתיים משתמשים בהם, כך שתוכל להוכיח שדף נגיש לפני שאתה פורס ולא אחרי ש-Search Console אומר לך שהוא לא.

TL;DR: Robots.txt אומר לסורקים מה הם עשויים להביא הוא אינו מסיר דפים מתוצאות החיפוש, ואינו מגן על שום דבר פרטי - הקובץ הוא ציבורי, והתאימות היא וולונטרית הכללים חלים רק בתוך א User-agent: קבוצה, נתיבים חייבים להתחיל עם /, * תואם לכל דבר, נגרר $ מעגן את הסוף, וכאשר שני חוקים תואמים, הדפוס הארוך ביותר מנצח עם אפשר לשבור קשרים. ה מחולל robots.txt בונה, מסיק ובודק את כל זה בדפדפן שלך.

מה robots.txt שולט למעשה

Robots.txt היא הנחיית סריקה, לא הנחיית אינדקס ההבחנה הבודדת הזו מסבירה את רוב הבלבול סביבה.

כאשר סורק רוצה להביא כתובת URL במארח שלך, הוא מביא תחילה https://yourhost/robots.txt ובודק האם ה-URL מותר.If a Disallow כללים תואמים, סורק מתנהג היטב לא מבקש את הדף זה כל המנגנון זה שולט בבקשת HTTP, ותו לא.

מה שהיא לא עושה זה להסיר כתובת URL מאינדקס החיפוש. Google יכולה ועושה אינדקס כתובות אתרים שמעולם לא הביאה, תוך שימוש רק בטקסט העוגן ובהקשר של קישורים המצביעים עליהם. אם תחסום /pricing ב robots.txt וחמישים אתרים מקשרים ל /pricing, Google עדיין עשויה להראות את כתובת האתר הזו בתוצאות - בדרך כלל ללא תיאור, מכיוון שהיא לעולם לא קוראת את הדף. חסימת כתובת אתר שאתה רוצה מהחיפוש פועלת נגדך באופן פעיל: ה noindex תג שיסיר אותו חי בתוך הדף, וסורק שאסור להביא את הדף לעולם לא יוכל לראות אותו הרצף הנכון הוא לאפשר סריקה, הגשה <meta name="robots" content="noindex"> או an X-Robots-Tag: noindex כותרת, המתן עד שהדף ייפול, ורק אז חסום אותו אם ברצונך לשמור תקציב סריקה.

זה גם לא מגן על שום דבר. Robots.txt מוגש בפומבי בנתיב ידוע; כל אחד, כולל כל תוקף באינטרנט, יכול לקרוא את שלך בדפדפן. א Disallow: /internal-admin-v2/ קו הוא שלט המצביע על הדבר שרצית להסתיר מגרדים זדוניים מתעלמים לחלוטין מהקובץ - כיבוד זה הוא מוסכמה מרצון, לא מנגנון אכיפה כל דבר שחייב להיות פרטי צריך אימות או רשימת הרשאות IP. Robots.txt היא בקשה, שנעשתה בנימוס, לסורקים שבוחרים להקשיב.

תכונות עיקריות של מחולל Robots.txt

עורך קבוצות מובנה

הקובץ&#39;s דקדוק הוא קבוצות: אחת או יותר User-agent: שורות ואחריהן הכללים החלים עליהם כתיבה שמזמינה ביד את הבאג המבני היחיד הנפוץ ביותר, שהוא כלל שצף מעל הראשון User-agent: קו שבו הוא חל על אף אחד המחולל בונה קבוצות כאובייקטים מהשורה הראשונה, כך שכל כלל שאתה מוסיף שייך בהכרח לקבוצה.

מאמת שמדווח על רובי הרגל האמיתיים

הלינטר פועל על כל הקשה ומדווח על שגיאות, אזהרות והערות עם מספרי שורות. זה מסמן כללים מחוץ לכל קבוצה, נתיבים חסרים את הלוכסן המוביל שלהם, חשוף Disallow: ללא ערך (שפירושו &quot;allow everything&quot; וכמעט אף פעם לא הייתה כוונת המחבר), כתובות URL של מפת אתר שאינן מוחלטות, $ בשימוש בכל מקום מלבד סוף דפוס, הנחיות לא ידועות, קבוצות משתמש-סוכנים כפולות, ובקול רם - א Disallow: / יושב מתחת User-agent: *.

בודק כתובות אתרים אמיתי

הזן נתיב ו משתמש-סוכן והכלי מדווח מותר או אסור, בתוספת הכלל המדויק שהחליט את זה לוגיקה קדימות הוא האמיתי מ RFC 9309: תבנית הנתיב התואמת הארוכה ביותר מנצחת ללא קשר לכללי הסדר המופיעים בקובץ, ואם שתי תבניות באותו אורך, אפשר פעימות לא לאפשר. זהו החלק שאנשים טועים לרוב מהאינטואיציה, מכיוון שהוא לא מתנהג כמו חומת אש &#39;s כללי זכייה במשחק הראשון.

הגדרות קבועות מראש בלחיצה אחת

אפשר הכל, חסום הכל, וורדפרס, Shopify, Next.js וסורקי AI בלוק ממלאים כל אחד את הטופס בנקודת התחלה נכונה והגיונית. הבלוקים המוגדרים מראש של וורדפרס /wp-admin/ תוך כדי גילוף /wp-admin/admin-ajax.php, שקבצים רבים בכתב יד שוכחים ובכך שוברים את הפונקציונליות הקדמית שגוגל צריכה כדי לעבד את הדף.

בקרות סורק בינה מלאכותית

לחיצה אחת מוסיפה קבוצות סירוב עבור GPTBot, ClaudeBot, PerplexityBot, CCBot, Google-Extended, Bytespider ו-anthropic-ai, תוך השארת Googlebot ו-Bingbot חופשיים לסרוק. הטבלה הידועה-סורקת מסבירה מה כל בוט עושה בפועל, אז אתה עושה בחירה מושכלת במקום להדביק רשימה מפוסט בבלוג.

מנתח את הקובץ הקיים שלך

הדבק את robots.txt שאתה כבר משרת והכלי קורא אותו בחזרה לקבוצות הניתנות לעריכה רוב עבודת robots.txt אינה שדה ירוק - היא ביקורת ותיקון של משהו שנכתב לפני שלוש שנים על ידי מישהו שעזב - ולהתחיל ממה שהוא חי בפועל היא הדרך השפויה היחידה לעשות זאת.

הכל נשאר בדפדפן שלך

הקובץ נוצר, מואר ונבדק כולו ב-JavaScript בצד הלקוח. שום דבר לא מועלה, כך שתוכל לנסח בבטחה כללים עבור מארח בימוי או קטע ללא הודעה מוקדמת באתר, והכלי פועל במצב לא מקוון לאחר הטעינה.

כיצד להשתמש מחולל Robots.txt

שלב 1: התחל מתוך הגדרה מראש, או ייבא את מה שכבר יש לך

אם אתה מתחיל טרי, בחר את ההגדרה מראש הקרובה ביותר לערימה שלך אם אתה כבר משרת robots.txt, הבא אותו מ https://yoursite.com/robots.txt, הדבק אותו בתיבת הייבוא, ולחץ על נתח לקבוצות הכלי משחזר את מבנה הקבוצה, והמאמת אומר לך מיד מה לא בסדר בקובץ שהרצת בייצור.

שלב 2: בנה את קבוצות המשתמש-סוכן שלך

כל קבוצה מכוונת לסורק אחד או יותר. הוסף סורקים מרשימת הבוטים הידועים או הקלד אסימון ישירות - אסימונים מותאמים ללא רגישות רישיות, אז googlebot ו Googlebot שוות ערך.A group with * האם התופס הכל: הוא חל על כל זוחל שאין לו קבוצה ספציפית יותר משלו.

הדבר הקריטי להפנים כאן הוא שסורקים מצייתים בדיוק לקבוצה אחת. Googlebot קורא את Googlebot קבוצה אם אחד קיים ומתעלם מה * קבוצה לגמרי - זה לא ממזג אותם אם אתה יוצר א Googlebot קבוצה כדי להוסיף כלל אחד, עליך לחזור על כל כלל מה- * קבוצה בתוכו, או Googlebot יפסיק בשקט לציית לכולם זה מפתיע כמעט את כולם בפעם הראשונה.

שלב 3: הוסף כללים, מפות אתר וקרא את המאמת

הוסף אל תאפשר נתיבים עבור מה שאתה רוצה שסורקים ידלגו, ואפשר נתיבים עבור הגילופים בתוכם. הוסף עיכוב סריקה רק אם אתה מכוון למנוע שמכבד אחד. הוסף את כתובות האתרים של מפת האתר שלך - אלה חייבים להיות מוחלטים, כולל סכימה ומארח, והם יושבים מחוץ לכל קבוצה, חלים על כולם.

לאחר מכן קרא את המאמת שגיאות הן דברים שלא יעבדו אזהרות הן דברים שכנראה לא מתכוונים למה שאתה חושב הערות הן הזדמנויות תקן הכל אדום לפני שאתה הולך רחוק יותר.

שלב 4: בדוק את כתובות האתרים שבאמת אכפת לך מהן

זה הצעד שאנשים מדלגים ולא צריכים. קח את שלושת או ארבעת הנתיבים שסטטוס הסריקה שלהם באמת חשוב - דפי המוצר שלך, הבלוג שלך, מסלול הניהול שאתה חושב שחסמת, קובץ ה-CSS שגוגל צריך כדי להציג את הפריסה שלך - ובדוק כל אחד מהם מול Googlebot. הכלי אומר לך מותר או אסור וקורא לכלל האחראי. אם תוצאה מפתיעה אותך, הכללים שלך לא אומרים את מה שאתה חושב שהם אומרים, וזה הרבה יותר זול ללמוד את זה עכשיו.

שלב 5: העתק או הורד ופריסה לשורש

העתק את הקובץ או הורד robots.txt, אז תגיש את זה בדיוק https://yourhost/robots.txt עם א 200 סטטוס וא text/plain סוג תוכן. Nowhere other works. /blog/robots.txt אינו נקרא על ידי אף אחד.

פרוטוקול אי הכללת רובוטים, בפירוט

סוף סוף זה סטנדרט

במשך עשרים וחמש שנים robots.txt היה מוסכמה שתוארה בפוסט ברשימת תפוצה משנת 1994, וסורקים פירשו כל אחד את העמימות בדרכו שלו. בשנת 2022 הוא פורסם בשם RFC 9309, שמקודד את כללי הניתוח, הסמנטיקה התואמת וסדר העדיפויות שגוגל, בינג והסורקים הרציניים ביותר התכנסו אליו. כאשר מדריך זה אומר &quot; הכלל הוא X&quot;, זה אומר ש-RFC 9309 אומר X - לא שפוסט בבלוג טוען זאת.

קבוצות, ומדוע זוחלים מצייתים רק לאחת

רשומה מורכבת מאחד או יותר עוקבים User-agent: שורות ואחריהן שורות החוקים החלות עליהן סורק מזדהה עם אסימון מוצר - Googlebot, Bingbot, GPTBot- ומחפש את הקבוצה שהאסימון שלה הכי מתאים באופן ספציפי זה מציית לקבוצה אחת ולא אחרת. ה * הקבוצה היא החזרה, בשימוש רק כאשר שום דבר ספציפי יותר לא תואם.

יש לחזור על התוצאה המעשית כי היא גורמת כל כך הרבה נזק: קבוצות לא יורשות. קובץ שקורא

User-agent: *
Disallow: /admin/
Disallow: /cart

User-agent: Googlebot
Disallow: /internal/

פירושו ש-Googlebot עשוי לזחול /admin/ ו /cart free.It מצא קבוצה משלו, כך ה * קבוצה בלתי נראית לה אם אתה רוצה ש-Googlebot חסום מכל השלושה, כל שלושת הכללים חייבים להופיע בתוך Googlebot קבוצה.

עדיפות המשחק הארוך ביותר

כאשר שני כללים או יותר בקבוצה הרלוונטית תואמים כתובת URL, המנצח הוא זה עם דפוס הנתיב הארוך ביותר, נמדד בתווים סדר בקובץ לא רלוונטי אם ההתאמה הארוכה ביותר אפשר וההתאמה הארוכה ביותר לא לאפשר הם באותו אורך, לאפשר מנצח.

User-agent: *
Disallow: /admin
Allow: /admin/public

לפי כללים אלה, /admin/public/logo.png הוא מותר- תבנית אפשר היא 13 תווים מול Disallow&#39;s 6 - תוך כדי /admin/secret הוא אסור, מכיוון שרק תבנית Disallow תואמת אותו. זהו המנגנון מאחורי כל &quot;חסום את הספרייה, אפשר קובץ אחד בתוכה&quot; דפוס, כולל WordPress&#39;s admin-ajax.php לְגַזֵב. זו גם הסיבה שכתיבת כללים מלמעלה למטה כמו תצורת חומת אש מייצרת אינטואיציות שגויות: אין ניצחונות במשחק הראשון, אין נפילה ואין הזמנה.

תווים כלליים והעוגן הקצה

שתי דמויות מיוחדות נתמכות בדפוסי נתיב.

* תואם לכל רצף של תווים, כולל אף אחד. Disallow: /*?sessionid= חוסם כל כתובת URL המכילה את פרמטר השאילתה הזה בכל מקום.

$ מעגן את סוף כתובת האתר, ורק אומר שכאשר הוא התו הסופי של התבנית. Disallow: /*.pdf$ בלוקים /whitepaper.pdf אבל לא /whitepaper.pdf?download=1, כי כתובת האתר הזו לא מסתיימת ב .pdf. זרוק את $ ואתה חוסם את שניהם - יחד עם כל דבר אחר שדרכו רק מכילה .pdf.

בלי א $, התאמה היא א התאמת קידומת, שמכשיל אנשים ללא הרף. Disallow: /admin בלוקים /admin, /admin/, /admin/users, וגם /administrator ו /admin-tools, כי כולם מתחילים עם המחרוזת /admin. אם התכוונת רק לספרייה, כתוב /admin/.

עיכוב זחילה אינו מכובד באופן אוניברסלי

Crawl-delay: 10 מבקש מזחל להמתין עשר שניות בין בקשות. בינג, יאנדקס וזוחלים קטנים יותר מכבדים את זה. גוגלבוט מתעלם מזה לחלוטין- Google מתאימה את קצב הסריקה בהתבסס על זמני התגובה של השרת וההגדרה ב-Search Console, לא על הנחיה בקובץ שלך. הגדרת עיכוב סריקה גדול באתר גדול היא אקדח רגל בהילוך איטי: ב-10 שניות לכל בקשה, אתר בן 100,000 עמודים לוקח כמעט שנים עשר ימים לסרוק פעם אחת, ובפועל חלק גדול ממנו אף פעם לא נסרק בכלל. אם הסריקה באמת פוגעת בשרת שלך, תקן את השרת או שמור את הדפים במטמון; מצערת הסורק בעיקר פשוט הופכת אותך לבלתי נראה.

חסימת סורקי AI

סורקי הבינה המלאכותית מתחלקים לשתי קטגוריות שאנשים מתמזגים באופן שגרתי. סורקי הדרכה - GPTBot, ClaudeBot, CCBot, Bytespider, Google-Extended - אוספים תוכן המשמש להכשרת דגמים. סורקי מנועי תשובות, ש-PerplexityBot היא הדוגמה המובהקת ביותר שלהם, מביאים דפים כדי שניתן יהיה לצטט אותם בתשובות שנוצרו, מה שיכול לשלוח לך תעבורת הפניות. חסימת הקטגוריה הראשונה מגינה על התוכן שלך מפני קליטה במודל; חסימת השנייה מסירה אותך ממשטח שבו אתה עלול להיות מצוטט אחרת.

Google-Extended ראוי להערה ספציפית כי השם שלו מטעה. זה לא סורק. זהו אסימון השולט אם תוכן שכבר הובא על ידי Googlebot עשוי לשמש לאימון בינה מלאכותית של Gemini ו-Vertex. לא לאפשר זאת שום השפעה בחיפוש Google סריקה, אינדקס או דירוג. you can refire Google&#39;s AI training use and keep your Search presence ototly intact.

והסייג שחל על כולם: הציות הוא וולונטרי חסימת עצירות GPTBot OpenAI&#39;s הכריז סורק כי OpenAI בוחר לכבד את הקובץ. זה לא עושה כלום לגבי מגרד שמשקר לגבי סוכן המשתמש שלו, ואין הנחיית robots.txt שיכולה.

התייחסות להנחיה

הוראה היקף מטרה מכובד על ידי
User-agent: פותח קבוצה שמות הסורק(ים) שהכללים הבאים חלים עליהם. * הוא התופס-הכל. כולם
Disallow: בתוך קבוצה מבקש מהסורק לא להביא כתובות URL התואמות לנתיב. חשוף Disallow: ללא ערך פירושו &quot;אפשר הכל&quot;. כולם
Allow: בתוך קבוצה מגלף חריג מתוך רחב יותר Disallow. מנצח בתיקו לפי המשחק הארוך ביותר. גוגל, בינג, רוב הסורקים המודרניים
Crawl-delay: בתוך קבוצה מינימום שניות בין בקשות. בינג, Yandex, אחרים - לא גוגלבוט
Sitemap: גלובל כתובת URL מוחלטת של מפת אתר או אינדקס מפת אתר חלה על כל הסורקים ללא קשר למיקום. גוגל, בינג, רוב הסורקים
Host: גלובל מראה/דומיין מועדף. סיומת Yandex. Yandex בלבד
Noindex: - - לא עובד. גוגל הפסיקה את התמיכה ב-2019. השתמש ב-a noindex מטא תג או X-Robots-Tag כותרת. אף אחד
# בכל מקום הערה כל מה שאחריו על הקו מתעלם. כולם

מקרי שימוש נפוצים

שמירה על זבל מחוץ למדד מבלי לחסום שום דבר חשוב

עבודת הלחם והחמאה: חסימת כתובות URL לחיפוש פנים, מחרוזות שאילתות הפעלה-מזהה, תוצאות חיפוש פנימיות ודפי עגלה או קופה, כך שסורקים מוציאים את התקציב שלהם על דפים שיכולים למעשה לדרג. המלכודת חוסמת יתר על המידה. כלל כמו Disallow: /*? חוסם כל כתובת URL עם מחרוזת שאילתה, אשר באתרים רבים כולל דפי קטגוריה paginated אתה מאוד רוצה נסרק בדוק את הדפוסים לפני המשלוח אותם.

לוקח אתר בימוי חשוך

User-agent: * פלוס Disallow: / האם הקריאה הנכונה לסביבת בימוי או תצוגה מקדימה, והגדרה מראש של Block everything מייצרת אותה. אבל התייחסו לזה כאל היגיינה, לא אבטחה: סביבות בימוי צריכות להיות גם מאחורי אישור HTTP או רשימת הרשאות IP, מכיוון ש-robots.txt לא מסתיר את המארח ולא עוצר אף אחד מלגלוש בו. ואסור לקדם את הקובץ לייצור לעולם - שים אותו בצינור הפריסה &#39; סקירת הבדל, כי הטעות המדויקת הזו היא הדרך הנפוצה ביותר שבה אתרים נעלמים מגוגל.

תיקון אתר שנשר מהחיפוש

כאשר תנועה אורגנית נופלת מצוק, /robots.txt הוא הדבר הראשון שיש לבדוק, לפני האלגוריתם עדכונים ואת ביקורות backlink.הדבק את הקובץ החי לתוך המחולל ולקרוא את פלט המאמת.A תועה Disallow: /, כלל שחוסם את ה-CSS ו-JavaScript Googlebot צריך לעבד את הדף, או א Googlebot קבוצה שעוקפת בטעות כתובה בקפידה * קבוצה תופיע מיד.

החלטה מה סורקי AI עשויים לעשות עם התוכן שלך

מפרסמים, אתרי תיעוד, וכל מי שהתוכן שלו הוא המוצר יש עכשיו החלטה אמיתית לעשות על סורק אימון.The בלוק AI סורק מוגדר מראש נותן לך ברירת מחדל להגנה - מנועי חיפוש בברכה, סורקי אימון סירב - ואת שולחן הסורק מסביר כל אחד כך שאתה יכול לעשות חריגים בכוונה, כגון שמירה על PerplexityBot מותר עבור התנועה הפניה תוך סירוב הבוטים אימון טהור.

ביקורת אתר שעבר בירושה

אתה משתלט על אתר ואף אחד לא יודע למה /resources/ אינו באינדקס ייבוא robots.txt החי, להפעיל את הבוחן נגד הנתיבים בשאלה, ואת שמות כלי את הכלל המדויק עושה את זה.This לוקח דקה ומחליף אחר צהריים של ניחוש.

למה ליצור robots.txt בדפדפן

ה מחולל robots.txt פועל לחלוטין בצד הלקוח הנתיבים, שמות המארחים והכללים שלך לעולם אינם עוזבים את המכונה, מה שחשוב יותר ממה שזה עשוי להיראות - מבנה הספריות של מוצר שלא פורסם, כתובת האתר של מארח בימוי והמסלולים הפנימיים שאתה מנסה לשמור על שקט הם כל הדברים ששווה לא להדביק במישהו אחר &#39;s יומני שרת ברגע שהדף נטען הוא עובד במצב לא מקוון, והפלט הוא קובץ טקסט רגיל שבבעלותך.

Robots.txt יושב לצד כמה עבודות שכנות. ה מחולל מטא תגים מייצר את noindex ותגים קנוניים שעושים את העבודה robots.txt לא יכול. ה פתח תצוגה מקדימה של גרף מראה כיצד הקישורים שלך יעבדו ברגע שהסורקים האלה שאפשרו יבואו להביא אותם. וה מְרַגֵל בונה את הנתיבים הנקיים שהכללים שלך יתאימו בסופו של דבר.

שָׁוא

איפה אני שם את קובץ ה-robots.txt?

יש להגיש בדיוק /robots.txt על המארח זה חל על - למשל https://example.com/robots.txt. סורקים לא מסתכלים לשום מקום אחר. קובץ ב /blog/robots.txt מתעלמים לחלוטין, והקובץ פועל example.com לא מושל shop.example.com; כל מארח צריך את שלו. הגישו אותו בסטטוס 200 וא text/plain סוג תוכן.

האם לא מאפשר להסיר דף מגוגל?

לא, וזו אי ההבנה הנובעת ביותר לגבי הפורמט. Disallow עוצר את Google מלהביא דף; הוא אינו מסיר את כתובת האתר מהאינדקס. אם אתרים אחרים מקשרים לכתובת URL חסומה, Google עדיין יכולה לרשום אותה, בדרך כלל ללא תיאור מכיוון שהיא מעולם לא קראה את הדף. כדי להרחיק דף מתוצאות החיפוש, אפשר סריקה והגש א noindex תג מטא רובוטים או X-Robots-Tag כותרת. אם תחסום את כתובת האתר, הסורק לעולם לא יוכל לראות את ה-noindex שהוספת.

האם robots.txt היא דרך להסתיר דפים פרטיים?

מס 'זה קובץ ציבורי שכל אחד יכול לקרוא, וכיבוד זה מרצון - מגרדים זדוניים להתעלם ממנו לחלוטין. Listing /internal-admin/ בכללי ה-Disallow שלך אומר לכל תוקף היכן בדיוק לחפש כל דבר שחייב להישאר פרטי צריך אימות, רשימת הרשאות IP או לא להיות באינטרנט הציבורי בכלל.

כיצד לאפשר ולא לאפשר אינטראקציה כאשר שניהם תואמים כתובת URL?

הכלל הספציפי ביותר מנצח, כאשר ספציפיות פירושה אורך תבנית הנתיב. נתון Disallow: /admin ו Allow: /admin/public, כתובת האתר /admin/public מותר כי תבנית אפשר ארוכה יותר, בעוד /admin/secret נחסם אם שני דפוסים הם בדיוק באותו אורך, אפשר ניצחונות כללי הסדר מופיעים בקובץ לא משנה, מה שמפתיע אנשים שמצפים להתנהגות של ניצחונות במשחק הראשון בסגנון חומת אש.

מה עושים התווים הכלליים * ו-$?

כוכבית תואמת לכל רצף של תווים, אז Disallow: /*?sessionid= חוסם כל כתובת אתר המכילה את הפרמטר הזה סימן דולר מעגן את סוף כתובת האתר, אז Disallow: /*.pdf$ בלוקים /report.pdf אבל לא /report.pdf?download=1. בלי א $, התאמה היא התאמת קידומת: Disallow: /admin בלוקים /admin, /admin/users, וגם /administrator, כי כולם מתחילים במחרוזת הזו.

איך אני חוסם סורקי בינה מלאכותית כמו gptbot ו-claudebot?

תן לכל אחד קבוצה משלו עם Disallow: /. ההגדרה המוגדרת מראש של Block AI עושה זאת עבור GPTBot, ClaudeBot, PerplexityBot, CCBot, Google-Extended, Bytespider ו-Anthropic-ai בלחיצה אחת תוך השארת Googlebot ו-Bingbot חופשיים לסרוק. שים לב ש-Google-Extended שולט רק בשימוש באימונים עבור Gemini ו-Vertex AI ואין לו השפעה על חיפוש Google. התאימות היא וולונטרית, כך שהדבר עוצר סורקים שיתופיים, לא מגרדים נחושים.

האם עיכוב זחילה באמת עובד?

זה תלוי בסורק. Googlebot מתעלם מזה לחלוטין - קצב הסריקה מותאם מ-Search Console ומשרתך &#39;s זמני תגובה. Bing, Yandex וכמה סורקים קטנים יותר אכן מכבדים אותו, ומתייחסים לערך כמספר השניות המינימלי בין בקשות. הגדרת עיכוב גדול באתר גדול יכולה לגרום לכך שרוב הדפים לעולם לא ייסרקו כלל, אז שמור על ערכים קטנים ותקן את קיבולת השרת במקום זאת אם הסריקה היא באמת בעיה.

מה קורה אם ל-robots.txt שלי יש שגיאת תחביר?

זוחלים משליכים בשקט קווים שהם לא יכולים לנתח וממשיכים עם השאר, כך שכלל שבור נכשל בשקט ולא בקול רם. הנחיה לא ידועה, נתיב שחסר את החתך המוביל שלו, או כלל המוצב מעל הראשון User-agent: קו פשוט לא עושה כלום, ולא תגלה עד שהתנועה שלך תזוז. בשביל זה בדיוק מיועד המאמת: הוא מדווח על כל אחד מאלה עם מספר שורה לפני שאתה פורס.

Frequently Asked Questions

It must be served at exactly /robots.txt on the host it applies to — for example https://example.com/robots.txt. Crawlers look nowhere else. A file at /blog/robots.txt is ignored entirely, and the file on example.com does not govern shop.example.com; each host needs its own. Serve it with a 200 status and a text/plain content type.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!