Command Palette

Search for a command to run...

XML 網站地圖產生器:建立網站地圖。xml 搜尋引擎信任

XML 網站地圖產生器:建立網站地圖。xml 搜尋引擎信任

T
Toolz Team
|Jul 26, 2026|17 閱讀

搜尋引擎優化工具 合集的一部分

我手寫的第一個網站地圖有一個錯誤,我花了一周的時間才注意到。我的一個 URL 有一個帶有&符號的查詢字串 - 類似 ?id=1&sort=name- 我把它直接貼到了一個 <loc> 標籤。 Google 搜尋控制台將整個網站地圖標記為無效,但錯誤訊息足夠模糊,我假設問題出在其他地方。不是。原始&符號在 XML 中是非法的;它必須寫成 &amp;. 一個角色破壞了整個文件,當我尋找一個我不明白的問題時,其中的每一頁都沒有提交。

那次經歷塑造了我對網站地圖的看法,並最終塑造了我為什麼添加網站地圖 XML 網站地圖產生器工具。dev。 網站地圖在概念上並不難--它是一個用標籤包裹的URL 列表--但格式是無情的,讓人們絆倒的部分正是機器應該處理的部分:轉義保留字符,驗證每個URL 是絕對的,捕捉重複項,並遵守協議&#39;s 大小限制。在為自己的專案運行 SEO 和建立 WordPress 外掛程式之間 WP 管理,我產生的網站地圖比我能數得的還要多,而且每次都會出現同樣多的錯誤。本指南介紹了網站地圖的實際內容、屬於其中的內容以及生成器如何刪除鋒利的邊緣。

TL;DR: XML 網站地圖是您的網站清單&#39;網站地圖。org 格式中的重要 URL,因此搜尋引擎可以有效地抓取它們。每個 <url> 需要一個 <loc> 並且可以攜帶可選 <lastmod>, <changefreq>, 和 <priority> 標籤。單一檔案的上限為 50,000 個 URL 和 50 MB。這 XML 網站地圖產生器 取得簡單的 URL 列表,正確轉義它們,刪除重複項,在限制處發出警告,並產生一個有效的網站地圖。xml,您可以下載並提交 - 所有這些都在您的瀏覽器中。

什麼是 XML 網站地圖?我需要一個嗎?

XML 網站地圖是一個文件,列出了您希望搜尋引擎了解的網站上的 URL。它遵循在 sitemaps。org 上發布並由 Google、Bing 和所有其他主要引擎支援的小型、定義明確的標準。該文件將每個 URL 包裝在一個 <url> 單一元素 <urlset>,並聲明一個命名空間,以便解析器知道它所說的是哪個版本的協定。

最小有效網站地圖如下所示:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/</loc>
  </url>
</urlset>

這就是整個形狀。其他一切--日期、頻率、優先順序--都是在一個所需元素之上的可選裝飾 <loc>.

您需要一個嗎?搜尋引擎主要透過追蹤連結來尋找頁面,因此如果沒有網站地圖,通常會發現一個連結良好的小型網站。但網站地圖可以在幾種常見情況下保持:大型網站,爬蟲可能無法以合理的跳數到達每個頁面;很少有外部連結指向它的新網站;內部頁面連接不良的網站,例如深度存檔內容;或經常更改並希望發出新鮮感的網站。網站地圖不保證索引 - 它是邀請,而不是命令 - 但它使您的重要 URL 易於找到,並且它為您提供了一個乾淨的管道來告訴 Google 其他可能錯過的頁面。

每個 URL 條目包含哪些資訊?

超出要求 <loc>,該協議定義了三個可選的子標籤,並且有很多關於它們有多重要的民間傳說。這是誠實的版本。

<loc> 是頁面URL。它必須是絕對的 - 從 開始 http:// 或者 https://- 完全合格,並且 XML 逃脫。這是我的舊&符號錯誤所在的標籤,生成器會自動逃脫五個 XML 特殊字符,因此您永遠不會擊中它。

<lastmod> 是頁面最後更改的日期,採用 W3C Datetime 格式:可以是普通的 2026-07-25 或完整的時間戳記,例如 2026-07-25T14:30:00+00:00. 這確實很重要。谷歌表示它正在使用 lastmod 作為何時重新抓取頁面的訊號, 前提是該值準確且一致. 如果您在每一頁上都印有 today&#39; 的日期,那麼您就在每個版本上對爬蟲撒謊,它會學會忽略您。使用真實的修改日期。

<changefreq> 提示頁面更改的頻率 - always, hourly, daily, weekly, monthly, yearly,或者 never. 谷歌已經明確表示,它在很大程度上忽略了這個標籤,最多將其視為一個微弱的暗示。包含它沒有任何壞處,但不要為此感到痛苦。

<priority> 是 0.0 到 1.0 之間的數字,表示頁面&#39;相對於的重要性 您自己網站上的其他頁面. 它不會影響您相對於其他網站的排名,Google也大多忽略它。常見的錯誤是將每個頁面設定為 1.0,這使得標籤毫無意義。如果您使用它,請為真正最重要的頁面保留高值。

發電機可以讓您申請 changefreq, priority, 和 lastmod 全域到每個 URL,並乾淨地省略任何您留空的標籤 - 因此,如果您想要一個簡單的網站地圖 <loc> 條目是一個完全有效且越來越受歡迎的選擇,你就會得到它。

如何建立 SiteMap.xml 檔案?

工作流程的建構速度很快,並消除了困擾手寫網站地圖的格式錯誤。

首先將 URL 貼到輸入中,每行一個。您可以貼上從 CMS、爬行或電子表格列匯出的清單。空白行以及任何以 開頭的行都會被忽略 # 被視為註釋,因此您可以註釋或暫時停用 URL,而無需刪除它們。每行都透過 WHATWG URL 解析器執行:如果它不是有效的、絕對的 http 或者 https URL,它被跳過並報告,因此偏離的相對路徑或拼字錯誤永遠不會默默地破壞輸出。

接下來,設定預設值。從下拉式選擇更改頻率,如果您需要優先級,請設定優先級,然後切換最後修改的日期 - 預設為今天,但您可以選擇任何日期。然後決定清理:啟用重複刪除 URL(預設為重複,因為重複) <loc> 條目是常見的複製貼上工件),並且可以選擇按字母順序對列表進行排序,以便更容易掃描和差異先前的版本。

當您更改任何內容時,輸出會即時更新。當它看起來正確時,複製 XML 或直接下載它 sitemap.xml. 該工具還報告輸入了多少 URL、文件大小、跳過的任何行以及原因 - 因此您可以清楚地了解文件中的內容,而不僅僅是您必須信任的 XML 區塊。

我將網站地圖放在哪裡以及如何提交?

產生文件就是一半的工作;另一半是讓搜尋引擎意識到這一點。

首先, 將 sitemap。xml 上傳到您的網站&#39;s 根 所以可以到達 https://yoursite.com/sitemap.xml. 位置比人們想像的要重要:網站地圖只能包含來自同一目錄層級或位於其所在位置的以下的 URL,因此將其放在根位置可以覆蓋整個網站。大多數主機和 CMS 平台允許您在 Web 根目錄中丟棄靜態文件,或者您可以從路由為其提供服務。

第二, 在 Google 搜尋控制台中提交網站地圖 URL 在索引 → 網站地圖下,以及在 Bing 網站管理員工具中的等效部分下。您貼上完整的 URL,引擎會取得它,報告它讀取了多少個 URL,並標記任何錯誤。這也是您將看到 Google 是否實際對頁面建立索引的地方,這與它是否讀取網站地圖是分開的。

第三--這是大多數人跳過的一步-- 在您的 robots。txt 中新增參考. 一行, Sitemap: https://yoursite.com/sitemap.xml,讓任何爬蟲自動發現您的網站地圖,而無需您將其提交到任何地方。這是皮帶和背帶的移動,它自然地與 robots.txt 產生器 在網站上,可以產生該文件,並且網站地圖行已經就位。這兩個工具被設計為一起使用:robots。txt 告訴爬蟲他們可以存取什麼,網站地圖告訴他們存在什麼。

尺寸限制是什麼?超過它們會發生什麼?

sitemaps。org 協定將單一網站地圖檔案大寫於 50,000 個 URL 和 50 MB 未壓縮. 這些是硬限制 - 違反任何一個的檔案都會被拒絕 - 它們的存在使得解析器不必將無界檔案載入到記憶體中。

對於大多數網站來說,這不是問題;早在空間耗盡之前,您的頁面就會用完。但大型電子商務目錄、新聞檔案和用戶生成的內容網站通常會超過 50,000 個 URL。當這種情況發生時,答案是 a 網站地圖索引:您將 URL 分割到多個網站地圖檔案(每個檔案都在限制範圍內),並建立一個列出它們的索引檔案。索引使用a <sitemapindex> 代替包裝紙 <urlset>,搜尋引擎首先取得索引,然後取得每個子站點的地圖。

生成器在建置時計算您的 URL 和輸出的位元組大小,並在突破任一限制時向您發出警告,並用簡單易懂的註釋告訴您在索引後面分割成多個檔案。這個早期警告是故意的--發現你超出限制的最糟糕時間是在你提交了一個文件後,然後搜尋控制台拒絕了。邊走邊知道你的計數會把失敗變成計劃決策。

比較:什麼屬於您的網站地圖,什麼不屬於

網站地圖是意向聲明 - &quot;這些是我想要索引和引用的規範頁面; - 所以你遺漏的內容和你放入的內容一樣重要。用垃圾填充它會發送混合訊號,並且可以稀釋谷歌對它的信任程度。

包括 排除
您想要排名的規範、可索引頁面 重複或非規範 URL
重要內容和類別頁面 頁面被 robots。txt 或 noindex 封鎖
您想要重新繪製的新頁面 重定向 (3xx) 和錯誤頁面 (4xx/5xx)
頁面內部連結較弱 具有追蹤參數或會話 ID 的 URL

指導原則是,網站地圖中的每個 URL 都應該傳回 200 狀態、規範且是您很樂意在搜尋結果中看到的頁面。列出 URL 不會迫使 Google 對其進行索引,並且列出您告訴 Google 在其他地方忽略的頁面(透過 noindex 標籤或 robots。txt 區塊)是矛盾的。最佳頁面的重點網站地圖始終優於爬蟲理論上可以到達的所有內容的詳盡轉儲。

SEO 工具包中的網站地圖產生器適合哪裡?

我將 toolz。dev 建置為一組連接的實用程序,而不是一堆不相關的小工具,並且技術 SEO 工具被設計為作為一個群組工作。網站地圖產生器與最直接配對 robots.txt 產生器- 這兩個文件是您的網站和爬蟲之間的標準握手,一個文件說明可以訪問的內容,另一個文件列出存在的內容。在頁面級別上, 元標記產生器 產生標題、描述和開放圖標記,這些標籤決定每個網站地圖 URL 在搜尋結果和社交分享中的顯示方式。當您自己建立 URL 時, 蛞蝓發電機 將頁面標題轉換為乾淨、可讀的路徑,這首先是一個很好的網站地圖。

連接它們的線程是,每個線程都精確地在本地完成一項工作,而無需上傳您的資料。最後一點對於網站地圖工具來說並不是偶然的:您的URL 清單實際上是整個網站結構的地圖,包括您可能尚未啟動的頁面,並且不應將其發送到第三方伺服器只是為了包裹在標籤中。這裡的所有內容都在您的瀏覽器中運行,這使得在暫存網站上使用以及在 NDA 下工作的客戶端可以安全 - 我在指南中詳細介紹了一種隱私立場 使用客戶端工具保持資料隱私。 我為現場的每個公用事業公司帶來了相同的建築理念,我將其拆包在 web 開發人員工具包指南:小型、鋒利、誠實的工具擊敗了臃腫的一體化平台,這些平台希望您的數據作為入場價格。

建立網站地圖時常見的錯誤

反覆出現的錯誤值得命名,這樣您就可以避免它們。首先, 逃脫的特殊角色- 我打開的&符號錯誤。生的 &, <, 和 > URL 中的字元會破壞 XML。產生器會自動轉義所有五個保留字符,但如果您隨後手動編輯文件,請記住它。

第二, 相對或協定相關的 URL. A <loc> 必須是絕對的並包括該計劃。 /about 或者 //example.com/about 均無效;僅有的 https://example.com/about 工作的。該工具拒絕並報告任何不是正確的絕對 URL 的內容,而不是傳遞它。

第三, 包括非規範或不可索引的 URL- 重定向、非索引頁面或帶有追蹤參數的重複。這些發送矛盾的訊號並浪費爬行預算。將網站地圖保留到規範的 200 個狀態頁面。

第四, 陳舊或不誠實 lastmod 日期。 在每次部署的每個頁面上標記當前日期會教導 Google 完全不信任該標籤。使用真實的修改日期,或離開 lastmod 關閉而不是偽造。

第五, 忘記重新提交或引用網站地圖. 產生檔案本身沒有任何作用 - 您必須上傳它,將其提交到搜尋控制台,並最好從 robots。txt 指向它。伺服器上沒有爬蟲被告知的一個網站地圖只是一個檔案。

常見問題

什麼是 XML 網站地圖?

XML 網站地圖是一個列出網站上重要 URL 的文件,以便搜尋引擎可以有效地找到並抓取它們。它遵循 sitemaps。org 協議,將每個 URL 包裹在一個 <url> 具有可選的最後修改日期、更改頻率和優先權的元素。提交一個可以幫助搜尋引擎發現內部連結不好的頁面。

如何建立 SiteMap.xml 檔案?

貼上您的網站&#39;將 URL 放入此產生器中,每行一個,設定您想要的變更頻率和優先級,然後將結果複製或下載為 sitemap。xml。將該檔案上傳到您的網站&#39; 的根目錄,使其駐留在 https://yoursite.com/sitemap.xml,並在 Google 搜尋控制台中提交其 URL。整個過程需要幾分鐘。

ChangeFreq 和 Priority 實際上做了什麼?

changefreq 暗示頁面更改的頻率和優先順序(0.0 到 1.0)表明其相對於您網站上其他頁面的重要性。兩者都是提示,而不是命令 - Google 表示它在很大程度上忽略了它們並依賴自己的訊號。它們沒有壞處,因此粗略設定 changefreq 並為最重要的頁面保留優先權 1.0。

一個網站地圖可以包含多少個 URL?

單一 SiteMap 檔案限制為 50,000 個 URL 和 50 MB 未壓縮。 如果您的網站較大,請將 URL 拆分到多個 SiteMap 檔案中,然後在 SiteMap 索引中列出這些檔案。 此工具會在跨越任何一個限制時立即警告您,以便您知道何時分解檔案。

lastmod 日期應該是什麼格式?

使用 W3C 日期時間格式:普通日期(如 2026-07-25)或完整時間戳(如 2026-07-25T14:30:00+00:00)。此產生器接受兩者並預設為今天&#39;啟用 lastmod 而不輸入 lastmod 的日期。準確的最後模式值可協助搜尋引擎優先重新繪製真正更改的頁面。

我需要在我的網站地圖中包含每個頁面嗎?

包含您想要排名的規範、可索引頁面,並省略重複項、重定向、錯誤頁面以及任何被 robots。txt 或 noindex 標籤阻止的內容。列出 URL 不保證索引,並且用低值 URL 填充檔案會發送混合訊號。最好的頁面的重點網站地圖比詳盡的頁面效果更好。

生成後在哪裡提交我的網站地圖?

將 sitemap。xml 上傳到您的網站根目錄,然後在 Google 搜尋控制台的索引 → 網站地圖和 Bing 網站管理員工具中提交其完整 URL。您也可以新增 &quot;網站地圖: https://yoursite.com/sitemap.xml&引用;連接到您的 robots。txt 文件,以便任何爬蟲都可以自動發現它。

我的網址清單是保密的嗎?

是的。整個網站地圖是在您的瀏覽器中使用普通的 JavaScript 建構的。您的 URL(可以暴露您的整個網站結構)永遠不會被傳輸、記錄或存儲,並且一旦頁面加載,該工具就會在沒有網路連接的情況下繼續工作。

Frequently Asked Questions

An XML sitemap is a file that lists the important URLs on your site so search engines can find and crawl them efficiently. It follows the sitemaps.org protocol, wrapping each URL in a url element with an optional last-modified date, change frequency, and priority. Submitting one helps search engines discover pages that are not well linked internally.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!