私が初めて手書きしたサイトマップには 気づくまでに1週間かかったバグがありました 私のURLの1つには アンパサンドの入ったクエリ文字列が - といったようなものでした ?id=1&sort=nameー そして、私はそれをaに直接貼り付けていました <loc> タグ。 Google Search Console はサイトマップ全体に無効であるとフラグを立てましたが、エラー メッセージがあいまいで、問題が他の場所にあると考えました。 そうではありませんでした。 生のアンパサンドは XML では違法です。次のように記述する必要があります。 &。 1 文字でファイル全体が壊れ、そのページのすべてのページが送信されず、理解できなかった問題を探していました。
その経験が、サイトマップについての考え方を形作り、最終的にはなぜ追加したのかについて考えました。 XML サイトマップ ジェネレーター にする Toolz.dev。 サイトマップは概念的にハードではありません - それはタグで包まれたURLのリストです - しかし、フォーマットは容赦なく、人々をトリップする部分はまさにマシンが処理すべき部分です: 予約文字のエスケープ、すべてのURLが絶対であることを検証、重複をキャッチ、プロトコル& #39; のサイズ制限の下で滞在する自分のプロジェクトのためのSEOを実行し、WordPressプラグインを構築するまでの間 WP アドミファイ、私は数えきれないほど多くのサイトマップを生成しましたが、毎回同じ一握りの間違いが繰り返されます。 このガイドでは、サイトマップが実際にどのようなものか、そこに属するもの、およびジェネレーターがどのように鋭いエッジを除去するかについて説明します。
tl;dr: XML サイトマップは、サイトマップ サーチ形式のサイトの重要な URL のリストであるため、検索エンジンが効率的にクロールできます。 それぞれ
<url>必要です<loc>オプションで持ち運べます<lastmod>、<changefreq>、そして<priority>タグ。 1 つのファイルは 50,000 URL と 50 MB で制限されています。 ザ・ XML サイトマップ ジェネレーター URL の単純なリストを取得し、正しくエスケープし、重複を削除し、制限内で警告し、ダウンロードして送信できる有効なサイトマップ.xml を生成します。これらはすべてブラウザで行われます。
XML サイトマップとは何ですか?必要なのは?
XML サイトマップは、検索エンジンに知ってもらいたいサイトの URL をリストするファイルです。 これは、Sitemaps.org で公開された、明確に定義された、Google、Bing、およびその他すべての主要エンジンによってサポートされる、明確な標準に従っています。 ファイルは各 URL をラップします。 <url> 単一の中の要素 <urlset>、パーサーがどのバージョンのプロトコルを話すかをパーサーが認識できるように名前空間を宣言します。
最小の有効なサイトマップは次のようになります。
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/</loc>
</url>
</urlset>
それが全体の形です。 else - 日付、頻度、優先順位 - はすべて、1 つの必須要素の上にオプションの装飾です、 <loc>。
1 つ必要ですか? 検索エンジンは、主にリンクをたどることによってページを見つけるので、サイトマップなしで、小規模で、よくリンクされたサイトがうまく発見されることがよくあります。しかし、サイトマップは、いくつかの一般的な状況でそのキープを獲得します: クローラーが適度な数のホップですべてのページに到達しないかもしれない大規模なサイト; それを指している少数の外部リンクを持つ新しいサイト; 深いアーカイブコンテンツのように、内部的にうまく接続されていないページを持つサイト; または頻繁に変更され、新鮮さを知らせたいサイトマップは、インデックス作成を保証するものではありません - それは招待状であり、コマンドではありません - しかし、それはあなたの重要なURLを見つけるのは簡単になります、そしてそれはあなたがそうでなければ見逃すかもしれないページについてGoogleに伝えるためのきれいなチャネルをあなたに与えます。
各 URL エントリにはどのような情報が含まれますか?
必要以上 <loc>、プロトコルは 3 つのオプションの子タグを定義しており、それらがどれだけ重要かについては多くの民間伝承があります。 正直なバージョンはこちら。
<loc> はページのURLです。 - から始まる絶対でなければなりません http:// や https://- 完全に修飾され、XML-escaped.これは私の古いアンパサンドのバグが住んでいたタグであり、ジェネレーターは 5 つの XML 特殊文字を自動的にエスケープするため、ヒットすることはありません。
<lastmod> ページが最後に変更された日付、W3C DateTime 形式: どちらかのプレーン 2026-07-25 または、次のような完全なタイムスタンプ 2026-07-25T14:30:00+00:00。 これは本当に重要です。 Google は、それが使用していると述べています lastmod ページを再クロールするタイミングのシグナルとして、 値が正確で一貫している場合。 すべてのページに、すべてのビルドで今日の日付を刻印すると、クローラーに嘘をつき、無視することを学ぶでしょう。 実際の変更日を使用してください。
<changefreq> ページが変更される頻度をヒントします - always、 hourly、 daily、 weekly、 monthly、 yearly、または never。 Google は、このタグをほとんど無視していることを明らかにしており、それをせいぜい弱いヒントとして扱っています。 含めることは害はありませんが、それに苦しむことはありません。
<priority> 0.0 から 1.0 までの数値で、ページの重要性を示しています。 自分のサイトの他のページ。 他のサイトに対するランキングには影響しません。Google はほとんど無視します。 よくある間違いは、すべてのページを 1.0 に設定することで、タグが意味をなさないものになります。 使用する場合は、最も重要なページの高値を予約してください。
ジェネレーターを使用すると、適用できます changefreq、 priority、そして lastmod すべての URL に対してグローバルに、空白のままにするタグをきれいに省略します。そのため、裸のサイトマップが必要な場合は、 <loc> エントリは、完全に有効で、ますます人気が高まっている選択肢です。まさにそれを手に入れることができます。
sitemap.xml ファイルを作成するにはどうすればよいですか?
ワークフローは、手書きのサイトマップを悩ませるフォーマット エラーをなくすため、高速に構築されています。
1 行に 1 つずつ、入力に URL を貼り付けることから始めます。 CMS、クロール、またはスプレッドシートの列からエクスポートされたリストを貼り付けることができます。 空白行は無視され、で始まる行はすべて無視されます # コメントとして扱われるため、URL を削除せずに注釈を付けたり、一時的に無効にしたりできます。 すべての行は、WhatWG URL パーサーを介して実行されます。有効な絶対値でない場合 http や https URL はスキップされて報告されるため、迷走の相対パスやタイプミスが黙って出力を破損することはありません。
次に、デフォルトを設定します。 ドロップダウンから変更頻度を選択し、優先度が必要な場合は優先順位を設定し、最後に変更された日付をオンに切り替えます。デフォルトでは今日ですが、任意の日付を選択できます。次にクリーンアップを決定します。重複解除を有効にして、繰り返しの URL をドロップします (デフォルトでは重複しているため) <loc> エントリは一般的なコピー アンド ペースト アーティファクトであり、オプションでリストをアルファベット順に並べ替えて、以前のバージョンに対してスキャンして差分を簡単にすることができます。
何かを変更すると、出力の更新が有効になります。 正しく表示されたら、XML をコピーするか、直接ダウンロードします。 sitemap.xml。このツールは、入力された URL の数、ファイル サイズ、スキップした行とその理由も報告します。これにより、信頼する必要がある XML の塊だけでなく、ファイルに何が含まれたのかを正確に明確に把握できます。
サイトマップはどこに置き、どのように送信すればよいですか?
ファイルの生成は半分の仕事で、残りの半分は検索エンジンにそれを認識させることです。
まずは、 サイトマップ.xml をサイトのルートにアップロードします。 で、到達可能です https://yoursite.com/sitemap.xml。 場所は、人々が予想するよりも重要です。サイトマップには、同じディレクトリ レベルまたはその下にある場所の URL のみを含めることができるため、ルートに配置すると、サイト全体をカバーできます。 ほとんどのホストと CMS プラットフォームでは、静的ファイルを Web ルートにドロップするか、ルートから提供することができます。
2番目、 Google Search Console でサイトマップの URL を送信する インデックス作成 → サイトマップの下にあるものと、Bing ウェブマスター ツールの同等のセクションの下にあります。 完全な URL を貼り付け、エンジンがフェッチし、読み取り URL の数を報告し、エラーにフラグを立てます。 これは、Google が実際にページをインデックス化したかどうかを確認する場所でもあります。これは、サイトマップを読んだかどうかとは別のものです。
3つ目は - そしてこれはほとんどの人がスキップするステップです - robots.txt に参照を追加します。 1行、 Sitemap: https://yoursite.com/sitemap.xml、クロールは、サイトマップをどこにも送信せずに自動的に検出できます。 それはベルトとブレースの動きであり、自然に Robots.txt ジェネレーター サイトマップの行が既に配置されている場合、そのファイルを作成できます。 2 つのツールは、一緒に使用するように設計されています。robots.txt は、クローラにアクセスできるものを伝え、サイトマップは何が存在するかを伝えます。
サイズの制限はどのくらいですか?それを超えるとどうなりますか?
Sitemaps.org プロトコルは、単一のサイトマップ ファイルを次の場所に制限します。 50,000 URL と 50 MB の非圧縮。これらはハード リミットであり、どちらかを侵害するファイルは拒否されます。パーサーが境界のないファイルをメモリにロードする必要がないように、ハード リミットが存在します。
ほとんどのサイトでは、これは問題ではありません。部屋がなくなるまで、ページが不足してしまいます。 しかし、大規模な e コマース カタログ、ニュース アーカイブ、およびユーザー生成コンテンツ サイトは、日常的に 50,000 の URL を超えています。 それが起こったとき、答えは サイトマップ インデックス: URL を複数のサイトマップ ファイル (それぞれ制限の下) に分割し、それらをリストする 1 つのインデックス ファイルを作成します。 インデックスは、 <sitemapindex> 代わりにラッパー <urlset>、検索エンジンは、最初にインデックスを取得し、次に各子サイトマップを取得します。
ジェネレータは、ビルド時にURLと出力のバイトサイズをカウントし、どちらかの制限を超えた瞬間に警告し、平易な言葉でインデックスの後ろの複数のファイルに分割するように指示します。その早期警告は意図的です。制限を超えていることが判明する最悪の時期は、検索コンソールが拒否するファイルを送信した後です。実行中にカウントを知ると、失敗が計画の決定に変わります。
比較: サイトマップに含まれるものとそうでないもの
サイトマップは意思表示です - " これらは私がインデックス付けしたい正規のページです" - だからあなたが取り残すものはあなたが入れたものと同じくらい重要です.junkでそれをパッドに入れると混合信号が送信され、Googleがそれを信頼する量を薄めることができます。
| 含む | 除外する |
|---|---|
| ランク付けしたい正規のインデックス可能なページ | 重複または非正規の URL |
| 重要なコンテンツとカテゴリのページ | robots.txt または noindex によってブロックされたページ |
| 再クロールしたい新しいページ | リダイレクト (3xx) とエラー ページ (4xx/5xx) |
| 内部のリンクが弱いページ | トラッキング パラメータまたはセッション ID のある URL |
指針となる原則は、サイトマップ内のすべてのURLは200 ステータスを返し、正規であり、検索結果で見て喜ぶページであるべきだということです。 URLをリストしてもGoogleにインデックスを強制することはなく、Googleに他の場所で無視するように指示したページをリストすることは - noindexタグまたはrobots.txtブロックを介して - 矛盾しています。最高のページの集中サイトマップは、クローラーが理論的に到達できるすべての徹底的なダンプを一貫して上回ります。
サイトマップ ジェネレーターは SEO ツールキットのどこに収まりますか?
私は、無関係なガジェットの山ではなく、接続されたユーティリティのセットとして Toolz.dev を構築します。テクニカル seo ツールは、グループとして機能するように設計されています。 サイトマップ ジェネレーターは、 Robots.txt ジェネレーターー 2 つのファイルは、サイトとクローラー間の標準的なハンドシェイクであり、1 つは何にアクセスできるかを伝え、もう 1 つは何が存在するかをリストします。ページレベルでは、 メタ タグ ジェネレーター 検索結果とソーシャル共有で、サイトマップ URL のそれぞれがどのように表示されるかを決定するタイトル、説明、およびオープン グラフ タグを作成します。 そして、URL 自体を構築するときは、 スラッグジェネレーター ページのタイトルを、最初に優れたサイトマップにする、すっきりとした読みやすいパスに変えます。
それらをつなぐスレッドは、それぞれがデータをアップロードせずに、正確かつローカルに1 つのジョブを実行するというものです。 その最後の点は、サイトマップツールにとって偶発的なものではありません: あなたのURLリストは、あなたがまだ起動していないかもしれないページを含むサイト構造全体のマップであり、タグでラップされるためにサードパーティのサーバーに送信されるべきではありません ここですべてがブラウザで実行されるため、ステージングサイトやNDAの下でクライアント作業で使用するのが安全になります - プライバシースタンスのガイドに長々と書きました クライアント側のツールを使用してデータを非公開にする。 これは、サイトのすべてのユーティリティに私がもたらした同じ建物の哲学であり、それを解き明かした Web 開発者ツールキット ガイド: 小さくて鋭い正直なツールは、データを入場料として必要とする、肥大化したオールインワン プラットフォームに勝ります。
サイトマップを作成する際のよくある間違い
繰り返し発生するエラーは、名前を付ける価値があるので、回避できます。 まずは、 脱出されていない特殊文字ー開けたアンパサンドのバグです 生 &、 <、そして > URL 内の文字が XML を破る。 ジェネレーターは、予約済みの 5 文字すべてを自動的にエスケープしますが、後でファイルを手作業で編集する場合は、そのファイルを覚えておいてください。
2番目、 相対 URL またはプロトコル相対 URL。 あ <loc> 絶対的で、スキームを含める必要があります。 /about や //example.com/about どちらも無効です。ただ https://example.com/about 動作します。 このツールは、適切な絶対 URL でないものはすべて拒否して報告します。
3番目、 非正規または非インデックス化できない URL を含む- リダイレクト、インデックスなしページ、または追跡パラメーター付きの複製。これらは矛盾した信号を送信し、クロール予算を無駄にします。サイトマップを正規の 200 ステータス ページに保ちます。
4番目、 古いか不正直 lastmod 日程。 すべてのページに現在の日付を入力して、すべての展開でスタンプを押すと、Google はタグを完全に信用しないようになります。 実際の変更日を使用するか、退出する lastmod 偽造するのではなく、オフにします。
5番目、 サイトマップの再送信または参照を忘れている。 ファイルを生成してもそれ自体では何も行われません。ファイルをアップロードし、検索コンソールで送信し、理想的には robots.txt からファイルを参照する必要があります。サーバー上にあり、クローラーが知らされていないサイトマップは単なるファイルです。
よくある質問
XML サイトマップとは何ですか?
XML サイトマップは、サイト上の重要な URL をリストするファイルで、検索エンジンがそれらを効率的に見つけてクロールできるようにします。 これは、Sitemaps.org プロトコルに従い、各 URL を <url> オプションの最終変更日、変更頻度、および優先度を持つ要素。 1 つを送信すると、検索エンジンは内部でうまくリンクされていないページを見つけることができます。
sitemap.xml ファイルを作成するにはどうすればよいですか?
サイトの URL をこのジェネレーターに 1 行に 1 つ貼り付け、必要な変更頻度と優先順位を設定して、結果を sitemap.xml としてコピーまたはダウンロードします。 そのファイルを Web サイトのルート ディレクトリにアップロードして、そのファイルを保存します。 https://yoursite.com/sitemap.xml、その URL を Google Search Console に送信します。 プロセス全体に数分かかります。
ChangeFreq と Priority は実際に何をしますか?
changefreq は、ページが変更される頻度と優先順位 (0.0 ~ 1.0) が、サイト上の他のページと比較したその重要性を示唆するヒントです。どちらもコマンドではなくヒントです。Google は、ページをほとんど無視し、独自のシグナルに依存していると述べています。彼らは害を及ぼさないため、changefreq を大まかに設定し、最も重要なページに優先順位 1.0 を予約します。
1 つのサイトマップに含めることができる URL の数は?
1 つのサイトマップ ファイルは 50,000 の URL に制限され、50 MB の非圧縮に制限されています。 サイトが大きい場合は、URL を複数のサイトマップ ファイルに分割し、それらのファイルをサイトマップ インデックスにリストします。 このツールは、どちらの制限を超えたときにすぐに警告を発し、ファイルをいつ分割するかを知ることができます。
最終モッドの日付はどの形式にする必要がありますか?
W3C 日付時刻形式を使用: 2026-07-25 のようなプレーンな日付または 2026-07-25T14:30:00+00:00 のような完全なタイムスタンプのいずれか。 このジェネレーターは両方を受け入れ、デフォルトは今日の日付に設定されます。lastmod を入力せずに有効にします。 正確な LastMod 値は、検索エンジンが真に変更されたページの再クロールを優先するのに役立ちます。
サイトマップにすべてのページを含める必要がありますか?
ランク付けしたい正規のインデックス可能なページを含め、重複、リダイレクト、エラー ページ、または robots.txt または noindex タグによってブロックされたものはすべて除外します。 URL をリストしてもインデックス作成は保証されません。また、ファイルに低価値の URL をパディングしても、さまざまなシグナルが送信されます。 最適なページのサイトマップは、網羅的なページよりもうまく機能します。
サイトマップを生成した後、どこに送信すればよいですか?
サイトマップをサイトのルートにアップロードし、その完全な URL を Google サーチ コンソールで [インデックス作成] → [サイトマップ] および Bing ウェブマスター ツールで送信します。 「サイトマップ: https://yoursite.com/sitemap.xml「robots.txt ファイルに行なわれる」
私の URL リストは非公開ですか?
はい。サイトマップ全体は、プレーンな JavaScript を使用してブラウザーに構築されます。サイト構造全体を公開する可能性のある URL は、送信、ログ記録、保存されることはありません。また、ページが読み込まれると、ツールはネットワーク接続なしで動作し続けます。



