Command Palette

Search for a command to run...

robots.txt ジェネレーター: サイトのインデックスを解除せずにクロール ルールを作成、検証、テストする

robots.txt ジェネレーター: サイトのインデックスを解除せずにクロール ルールを作成、検証、テストする

T
Toolz Team
|Jul 19, 2026|21 分読んでください

SEO ツール コレクションの一部

私が今まで出荷した最も高価な 4 文字は Disallow: /。 チームがリリース中にステージング robots.txt を本番環境にプッシュしましたが、誰も気づきませんでした。その後 10 日間、Google はサイトのほとんどのページを静かに削除しました。 アラームを発生させるような方法でトラフィックがクラッシュすることはありませんでした。 誰かがチェックしようと思った頃には /robots.txt、回復は再クロールの 1 か月でした。 原因となったファイルは 4 行の長さでした。

Robots.txtは一見シンプルですプレーンテキストですおそらく6 つのディレクティブがあり知る価値があり構文はインデックスカードに収まりますそのシンプルさがまさに間違いですビルドステップもCIのリンターも型システムもエラーメッセージもありませんクローラーが解析できないというルールを書けばクローラーはその行を黙って無視して続けますあなたのファイルは問題なくサイトも問題なくブロックされたと思っていたものがクロールされています - あるいはクロールする必要があったものが問題ありません。

私が造る Toolz.dev そして、ステージング環境、クライアント サイト、および自分のプロジェクト用に常に robots.txt ファイルを作成するので、 Robots.txt ジェネレーター 障害モードを表示するため。 ファイルは構造化された形式からビルドされるため、構文は構造によって正しくなります。 それはあなたが書いたものを結び、フットガンに行番号を付けます。 また、実際のクローラーが使用するものと同じ最長一致の優先順位を使用してルールに照らして URL をテストするため、Search Console がそうでないことを Search Console が通知した後ではなく、展開前にページに到達できることを証明できます。

tl;dr: Robots.txt はクローラに何を取り出すかを指示します 検索結果からページを削除したり 非公開のものを保護したりしません - ファイルは公開されており コンプライアンスは任意です。 aの中でのみルールが適用されます User-agent: グループ、パスは開始する必要があります /* 何にでも合います、末尾 $ アンカーが終わり、2 つのルールが一致すると、最も長いパターンが勝利し、タイを破ることができます。 ザ・ Robots.txt ジェネレーター ブラウザですべてをビルド、リント、およびテストします。

robots.txt が実際にコントロールするもの

robots.txt はクロール ディレクティブであり、インデックス ディレクティブではありません。 この 1 つの違いは、その周りの混乱のほとんどを説明しています。

クローラがホストで URL を取得したい場合、最初にフェッチします https://yourhost/robots.txt URL が許可されているかどうかを確認します。 だったら Disallow ルールが一致すると、行儀の良いクローラーはページを要求しません。 それが全体の仕組みです。 これは HTTP 要求を管理し、それ以外は何も管理しません。

行っていないことは、検索インデックスから URL を削除することです。 Google は、アンカー テキストとリンクのコンテキストのみを使用して、取得したことのないインデックス URL を使用できます。 ブロックしたら /pricing robots.txt と 50 のサイトでリンクしている /pricing、Googleはまだ結果でそのURLを表示することがあります - それはページを読んでいないので、通常は説明なし. 、あなたが検索からしたいURLをブロックすると、積極的にあなたに対して動作します: the noindex それを削除するタグはページ内にあり、ページを取得できないクローラは決して表示されません。 正しい順序は、クロールを許可することです。 <meta name="robots" content="noindex"> それか、 X-Robots-Tag: noindex ヘッダー、ページがドロップアウトされるまで待機し、クロールの予算を節約したい場合にのみブロックします。

また、何も保護しません。 Robots.txt は、よく知られたパスで公開されます。インターネット上のすべての攻撃者を含め、誰でもブラウザで自分のパスを読み取ることができます。 あ Disallow: /internal-admin-v2/ lineは隠したかったものを示す道標です 悪意のあるスクレーパーはファイルを完全に無視します - それを尊重することは強制メカニズムではなく、自主的な慣習です プライベートでなければならないものはすべて認証またはIP許可リストが必要です Robots.txtは、聞くことを選択したクローラーに対して丁寧に行われるリクエストです。

robots.txt ジェネレーターの主な機能

構造化グループ エディタ

ファイルの文法はグループです: 1 つ以上 User-agent: 行に続く行に適用されるルール。 手書きで書くと、最も一般的な構造的なバグが 1 つ上に浮かんでいるルールがあります。 User-agent: 誰にも当てはまらない線。 ジェネレーターはグループを一流のオブジェクトとして構築するため、追加するすべてのルールは必然的にグループに属します。

本物のフットガンを報告するバリデーター

すべてのキーストロークでリンターが実行され、エラー、警告、および行番号付きのメモが報告されます。 それはどのグループ外でもルールにフラグを立て、パスは先頭のスラッシュを欠いていて、むき出しの Disallow: 値がない (「すべてを許可する」という意味であり、作者が意味するものはほとんどありません)、絶対的でないサイトマップ URL $ パターンの終わり、未知のディレクティブ、重複するユーザー エージェント グループ、および - 大声で - a 以外の場所で使用されます Disallow: / 座り込み User-agent: *

本当の URL テスター

パスと user-agent を入力し、ツールが許可または禁止を報告し、さらにそれを決定した正確なルールを入力します。 precedence ロジックは、からの実際のロジックです RFC 9309: 順序規則に関係なく、最も長いマッチングパスパターンが勝ちますファイルに表示されます、そして、2 つのパターンが同じ長さであれば、Allow beats Disallow.これは、人々が直感から最も頻繁に間違える部分です、なぜなら、それはファイアウォールのように動作しません& #39; s first-match-winsルール。

ワンクリックプリセット

すべてを許可し、すべてをブロック、WordPress、Shopify、Next.js、ブロック AI クローラがそれぞれフォーム全体に正しい賢明な開始点を入力します。 WordPress プリセット ブロック /wp-admin/ 切り出しながら /wp-admin/admin-ajax.phpというのは、多くの手書きファイルが忘れて、Google がページをレンダリングするために必要なフロントエンド機能を壊してしまうものです。

AI クローラー コントロール

ワンクリックで、GPTBOT、Claudebot、PerplexityBot、CCBot、Google-Extended、BytesPider、Anthropic-AI の拒否グループが追加され、Googlebot と Bingbot は自由にクロールできます。 既知のクローラー テーブルは、各ボットが実際に何をするかを説明しているため、ブログ投稿からリストを貼り付けるのではなく、情報に基づいた選択を行う必要があります。

既存のファイルを解析します

すでに提供している robots.txt を貼り付け、ツールはそれを編集可能なグループに読み返します。 robots.txt のほとんどの作業はグリーンフィールドではありません。退職した人が 3 年前に書いたものを監査して修復しています。そして、実際に生きているものから始めることが唯一の賢明な方法です。

すべてがブラウザに残ります

ファイルは、クライアント側の JavaScript で生成、リンテッド、テストされます。 何もアップロードされていないため、ステージング ホストまたはサイトの予告なしのセクションのルールを安全に作成できます。ツールは、ロードされたらオフラインで動作します。

robots.txt ジェネレーターの使い方

ステップ 1: プリセットから始めるか、すでに持っているものをインポートします

新たに始めた場合は、スタックに最も近いプリセットを選択してください。 すでに robots.txt を提供している場合は、そこから取得してください https://yoursite.com/robots.txtを押して、インポート ボックスに貼り付け、[グループ化] をクリックします。 ツールはグループ構造を再構築し、バリデーターは、実稼働で実行しているファイルの何が問題なのかをすぐに伝えます。

ステップ 2: ユーザー エージェント グループを構築する

各グループは1 つ以上のクローラを対象とします。 known-bot リストからクローラを追加するか、トークンを直接入力します - トークンは大文字と小文字を区別せずにマッチするためです googlebot あんど Googlebot 同等です。 とのグループ * キャッチオール: より具体的なグループを持たないクローラに適用されます。

ここで内在化する重要な点は、クローラーが 1 つのグループに従うだけであるということです。 Googlebot は、 Googlebot 1 つ存在し、それを無視する場合はグループ * 完全グループ化 - それらをマージしません。 a を作成した場合 Googlebot グループ ルールを 1 つ追加するには、すべてのルールを繰り返す必要があります。 * その中にグループを入れないと、Googlebot は黙ってそれらすべてに従うのをやめます。 これは、ほぼ全員が初めて驚いた。

ステップ 3: ルール、サイトマップを追加して、バリデーターを読みます

Add クローラーにスキップさせたいものに対してパスを許可しない、およびクローラー内部のカーブアウトに対してパスを許可する.Crawl-delay を追加するのは,1 を尊重するエンジンをターゲットにしている場合のみです. サイトマップ URL を追加します.これらは scheme と host を含む絶対的でなければならず, そしてそれらは任意のグループの外側に座り, 全員に適用されます.

次に、バリデーターを読みます。 エラーとは、機能しないものです。 警告とは、おそらくあなたが考えていることを意味しないものです。 メモはチャンスです。 さらに先に進む前に、すべてを赤く修正してください。

ステップ 4: 気になる URL をテストする

これは、人々がスキップして、スキップしてはいけないステップです。クロールステータスが真に重要な 3 つまたは 4 つのパスを選択してください - 製品ページ、ブログ、ブロックしたと思われる管理ルート、Google がレイアウトをレンダリングする必要がある CSS ファイル - そして、Googlebot に対してそれぞれをテストします。ツールは許可または禁止を指示し、責任のあるルールに名前を付けます。結果があなたを驚かせた場合、ルールにはあなたが言ったと思うことは記載されず、今すぐそれを学ぶ方がはるかに安くなります。

ステップ 5: コピーまたはダウンロードしてルートにデプロイする

ファイルをコピーするか、ダウンロードしてください robots.txt、それから正確に提供してください https://yourhost/robots.txt200 ステータスと text/plain コンテンツの種類。 他には機能しません。 /blog/robots.txt 誰にも読まれません。

ロボット除外プロトコル、詳細

やっと標準になった

25 年間、robots.txt は 1994 年のメーリング リストの投稿で説明されている慣習であり、クローラーはそれぞれのあいまいさを独自の方法で解釈していました。 2022年に出版された RFC 9309、これは、google、bing、およびほとんどの深刻なクローラーが収束していた解析ルール、一致するセマンティクス、および優先順位を成文化したものです。このガイドが &quot; と言うとき、ルールは X&quot; ですが、これは RFC 9309 が X と言うことを意味します。ブログ投稿がそれを主張するというわけではありません。

グループ、およびクローラーが 1 つだけに従う理由

レコードは、1 つ以上の連続で構成されています User-agent: それらに適用されるルール線が続く行 クローラは、プロダクトトークン - で自身を識別します GooglebotBingbotGPTBotー そして最も具体的にトークンが一致するグループを探します そのグループに従うもので 他のグループには従いません The * グループはフォールバックで、より具体的なものがない場合にのみ使用されます。

大きな損害を引き起こすため、実際の結果は繰り返されます。グループは継承されません。 読み取るファイル

User-agent: *
Disallow: /admin/
Disallow: /cart

User-agent: Googlebot
Disallow: /internal/

Googlebot がクロールできる可能性があることを意味します /admin/ あんど /cart 自由に。 それは自分のグループを見つけたので、 * グループはそれに見えません。 Googlebot を 3 つすべてからブロックする場合は、3 つのルールすべてが、 Googlebot グループ。

最長マッチ優先

該当するグループ内の 2 つ以上のルールが URL と一致する場合、勝者は、 最長パス パターン、文字で測定します。 ファイル内の順序は関係ありません。 最も一致する許可と最も一致する長さが一致しない場合は、許可を許可します。

User-agent: *
Disallow: /admin
Allow: /admin/public

これらのルールの下で、 /admin/public/logo.png です 許可しました- 許可パターンは、Disallow&#39;s に対して 13 文字です。 6 - 一方 /admin/secret です 許可されていない、禁止パターンのみが一致するためです。 これは、「ディレクトリをブロックするすべてのメカニズム」で、WordPress を含む、1 つのファイルをその中に入れることができます。 admin-ajax.php カーブアウト。 ファイアウォール設定のようにルールをトップダウンで書くと、間違った直感が生まれるのもこのためです。初戦勝利も、フォールスルーも、順序付けもありません。

ワイルドカードとエンドアンカー

パス パターンでは 2 つの特殊文字がサポートされています。

* 文字列に一致します。何も含めません。 Disallow: /*?sessionid= クエリ パラメータを含む URL をどこかにブロックします。

$ URL の末尾を固定し、それがパターンの最後の文字である場合にのみ意味します。 Disallow: /*.pdf$ ブロック /whitepaper.pdf でもない /whitepaper.pdf?download=1、その URL はで終わらないからです .pdf。 ドロップ $ そして、あなたは両方をブロックします - パスに含まれる他のものと一緒に .pdf

なしで $、マッチングは プレフィックスマッチ、常に人々をつまずかせます。 Disallow: /admin ブロック /admin/admin//admin/users、そしてまた /administrator あんど /admin-tools、それらはすべて文字列で始まるため /admin。 ディレクトリだけを意味する場合は、書き込みます /admin/

クロール遅延は普遍的に光栄に思っているわけではありません

Crawl-delay: 10 クローラに要求の間に 10 秒待つように要求します。 Bing、Yandex、およびさまざまな小さなクローラーがそれを称賛しています。 Googlebot は完全に無視します- Google は、サーバーの応答時間と、ファイル内のディレクティブではなく、検索コンソールでの設定に基づいてクロール レートを調整します。大規模なサイトで大きなクロール遅延を設定することは、スローモーション フットガンです。リクエストごとに 10 秒で、100,000 ページのサイトは 1 回クロールするのに 12 日近くかかり、実際にはその多くがまったくクロールされません。クロールが本当にサーバーを傷つけている場合は、サーバーを修正するか、ページをキャッシュします。クローラーを絞ると、ほとんど見えなくなるだけです。

AI クローラーのブロック

AI クローラーは、人々が日常的に混同している 2 つのカテゴリーに分かれています。 - GPTBot、ClaudeBot、CCBot、Bytespider、Google-Extended - トレーニング クローラーは、モデルのトレーニングに使用されるコンテンツを集めます。 Answer-engine クローラー (そのうち PerplexityBot が最も明確な例です) は、生成された回答で引用できるようにページをフェッチします。これにより、紹介トラフィックを送信できます。最初のカテゴリをブロックすると、コンテンツがモデルに吸収されるのを防ぎます。; 2 番目のカテゴリをブロックすると、他の方法で引用される可能性があるサーフェスから削除されます。

Google-Extended 名前が誤解を招くので、具体的な注意が必要です。 クローラーではありません。 これは、Googlebot によって既にフェッチされたコンテンツを Gemini および Vertex AI トレーニングに使用できるかどうかを制御するトークンです。 それを認めない 何の影響もない Google 検索でクロール、インデックス作成、またはランキング。 Google の AI トレーニングの使用を拒否し、検索の存在感を完全に維持することができます。

そして、それらすべてに適用される警告: コンプライアンスは自発的です。 gptbot をブロックすると、OpenAI がファイルを尊重することを選択したため、OpenAI&#39; の宣言されたクローラーが停止します。 ユーザー エージェントについてあるスクレーパーについては何もしません。また、robots.txt ディレクティブもありません。

ディレクティブ リファ

指示 範囲 目的 から敬意を表して
User-agent: グループを開く 次のルールが適用されるクローラの名前。 * キャッチオールです。 みんな
Disallow: グループ内 クローラにパスに一致する URL を取得しないように要求します。 むき出し Disallow: 値がないということは、「すべてを許可する」という意味です。 みんな
Allow: グループ内 より広い範囲から例外を切り分ける Disallow。 最長の試合で引き分けに勝つ。 Google、Bing、ほとんどの現代のクローラー
Crawl-delay: グループ内 リクエスト間の最短秒数。 Bing、Yandex、その他 - グーグルボットではない
Sitemap: グローバル サイトマップまたはサイトマップ インデックスの絶対 URL。 配置に関係なく、すべてのクローラーに適用されます。 Google、Bing、ほとんどのクローラー
Host: グローバル 優先ミラー/ドメイン。 Yandex 拡張機能。 ヤンデックスのみ
Noindex: 動作しません。 Google は 2019 年にサポートを停止しました。 を使用する noindex メタタグまたは X-Robots-Tag ヘッダー。 誰も
# どこでも コメント。 行にある後のすべては無視されます。 みんな

よくある使用例

重要なものをブロックせずに、ジャンクをインデックスから除外します

パンとバターのジョブ: ファセット検索 URL、セッション ID クエリ文字列、内部検索結果、カートまたはチェックアウト ページをブロックすることで、クローラは実際にランク付けできるページに予算を費やすことができます。 トラップはオーバーブロックです。 みたいなルール Disallow: /*? すべての URL をクエリ文字列でブロックします。多くのサイトで、ページングされたカテゴリ ページが非常にクロールされているページが含まれています。 パターンを出荷する前にテストしてください。

ステージング サイトを暗くする

User-agent: * プラス Disallow: / ステージング環境またはプレビュー環境の適切な呼び出しであり、ブロックすべてがプリセットされて生成されます。しかし、これをセキュリティではなく衛生として扱います。ステージング環境も HTTP 認証または IP 許可リストの背後にある必要があります。なぜなら、robots.txt はホストを隠したり、誰も閲覧するのを阻止したりしないからです。そして、ファイルは決して本番環境に昇格してはなりません。deploy pipeline&#39;s diff レビューに入れてください。なぜなら、この正確な間違いは、サイトが Google から消える最も一般的な唯一の方法だからです。

検索を終了したサイトを修正する

オーガニック トラフィックが崖から落ちたとき、 /robots.txt アルゴリズムが更新され、バックリンク監査が行われる前に、最初に確認する必要があります。 ライブ ファイルをジェネレーターに貼り付け、バリデーター出力を読み取ります。 野良だ Disallow: /、CSS と JavaScript をブロックするルールで、Googlebot はページをレンダリングする必要があります。 Googlebot 注意深く書かれたものを誤って上書きするグループ * グループはすぐに現れます。

AI クローラがあなたのコンテンツで何をするかを決める

パブリッシャー、ドキュメント サイト、およびコンテンツが製品である人は誰でも、クローラーのトレーニングについて実際に決定する必要があります。 「ブロック AI クローラー」プリセットでは、防御可能なデフォルトが提供されます。検索エンジンは歓迎され、トレーニング クローラーは拒否されました。クローラー テーブルでは、純粋なトレーニング ボットを拒否しながら、PerplexityBot を紹介トラフィックに対して許可し続けるなど、意図的に例外を作成できるように、それぞれが説明されています。

継承されたサイトの監査

あなたがサイトを乗っ取っても、その理由は誰にもわかりません /resources/ インデックスされていません。 ライブ robots.txt をインポートし、問題のパスに対してテスタを実行すると、ツールはそれを実行する正確なルールを指定します。 これには 1 分かかり、午後の推測に取って代わります。

なぜブラウザで robots.txt を生成するのか

ザ・ Robots.txt ジェネレーター 完全にクライアント側で実行されます。パス、ホスト名、ルールがマシンから離れることはありません。これは、思っている以上に重要です。未リリースの製品のディレクトリ構造、ステージング ホストの URL、および静かにしようとしている内部ルートはすべて、他のユーザーに貼り付けない価値があります。 #39;s サーバー ログ。ページがロードされるとオフラインで動作し、出力はあなたが所有するプレーン テキスト ファイルです。

Robots.txt は、いくつかの近隣の仕事と並んでいます。 ザ・ メタ タグ ジェネレーター を生成します noindex robots.txt を実行する正規のタグはできません。 ザ・ グラフのプレビューを開く クロールしたクローラが来てフェッチした後、リンクがどのようにレンダリングされるかを示します。 そして、 スラッグジェネレーター ルールが一致するクリーン パスを構築します。

フェイク

robots.txt ファイルはどこに置くの?

正確に提供する必要があります /robots.txt ホストでは、たとえば、それが適用されます https://example.com/robots.txt。 クローラーは他には見えません。 でファイル /blog/robots.txt 完全に無視され、ファイルは example.com 統治しない shop.example.com; 各ホストには独自のものが必要です。 200 ステータスと text/plain コンテンツの種類。

許可されていない場合、ページは Google から削除されますか?

いいえ、これは、フォーマットに関する最も重要な誤解です。 禁止を使用すると、Google はページを取得できなくなり、URL はインデックスから削除されません。 他のサイトがブロックされた URL にリンクされている場合でも、Google はページを読み込まないため、通常は説明なしでその URL をリストできます。 ページを検索結果に表示しないようにするには、クロールを許可して、 noindex ロボット メタ タグまたは X-Robots-Tag ヘッダー。 URL をブロックすると、追加した NoIndex がクローラに表示されません。

robots.txt はプライベート ページを非表示にする方法ですか?

いいえ それは誰でも読むことができる公開ファイルであり、それを尊重することは自発的です - 悪意のあるスクレーパーはそれを完全に無視します リスト /internal-admin/ 許可しないルールでは、すべての攻撃者にどこを見るべきかを正確に伝えます。 プライベートである必要があるものはすべて、認証、IP 許可リスト、またはパブリック インターネット上に置かないようにする必要があります。

URL と一致する場合、許可と非許可はどのように対話するのですか?

最も具体的なルールが有効です。ここで、具体性はパス パターンの長さを意味します。 所与 Disallow: /admin あんど Allow: /admin/public、URL /admin/public 許可パターンが長くなるため、許可されていますが、 /admin/secret ブロックされています。 2 つのパターンがまったく同じ長さなら、勝ち抜きましょう。 ファイルに表示される順序ルールは関係ありません。これは、ファイアウォール スタイルの初戦で勝利する行動を期待する人々を驚かせます。

* と $ ワイルドカードは何をしますか?

アスタリスクは任意の文字数に一致するため、 Disallow: /*?sessionid= そのパラメータを含むすべての URL をブロックします。 ドル記号が URL の最後を固定しているので、 Disallow: /*.pdf$ ブロック /report.pdf でもない /report.pdf?download=1。 なしで $、マッチングは接頭辞の一致です: Disallow: /admin ブロック /admin/admin/users、そしてまた /administrator、それらはすべてその文字列で始まるためです。

GPTBOT や Claudebot などの AI クローラーをブロックするにはどうすればよいですか?

それぞれに独自のグループを渡します Disallow: /。 ブロック AI クローラー プリセットは、gptbot、claudebot、perplexitybot、ccbot、google-extended、bytespider、anthropic-ai に対して、Googlebot と Bingbot が自由にクロールできるようにワンクリックでこれを行います。 Google 拡張機能は、Gemini と Vertex AI のトレーニングの使用のみを制御し、Google 検索には影響しません。 コンプライアンスは任意であるため、これにより、決定されたスクレーパーではなく、協力的なクローラーが停止します。

クロール遅延は実際に機能しますか?

それはクローラーによって異なります。 Googlebot はそれを完全に無視します。クロール率は、Search Console とサーバーから調整されます&#39; s の応答時間。 Bing、Yandex、およびいくつかの小さなクローラーはそれを尊重し、値をリクエスト間の最小秒数として扱います。大きなサイトで大きな遅延を設定すると、ほとんどのページがまったくクロールされない可能性があるため、値を小さく保ち、クロールが本当に問題がある場合は、代わりにサーバー容量を修正してください。

robots.txt に構文エラーがあるとどうなりますか?

クローラは、解析して残りの行を続行できない行を静かに破棄します。そのため、破られたルールは大声ではなく静かに失敗します。 不明なディレクティブ、先頭のスラッシュが見つからないパス、または最初のルールの上に配置されたルール User-agent: LINE は何もしないので、トラフィックが移動するまでわかりません。 それがまさにバリデーターの目的です。展開する前に、これらの各々に行番号を付けて報告します。

Frequently Asked Questions

It must be served at exactly /robots.txt on the host it applies to — for example https://example.com/robots.txt. Crawlers look nowhere else. A file at /blog/robots.txt is ignored entirely, and the file on example.com does not govern shop.example.com; each host needs its own. Serve it with a 200 status and a text/plain content type.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!