Command Palette

Search for a command to run...

Générateur de sitemap XML : Créez une confiance des moteurs de recherche SiteMap.xml

Générateur de sitemap XML : Créez une confiance des moteurs de recherche SiteMap.xml

T
Toolz Team
|Jul 26, 2026|17 min Lire

Fait partie de la collection Outils de référencement

Générateur de sitemap XML

Transformez une liste d'URL en un plan de site XML valide avec lastmod, changefreq et priorité - prêt à être soumis à la console de recherche Google. 100 % côté client.

Utiliser Générateur de sitemap XML

Le premier plan de site que j'ai écrit à la main avait un bug qui m'a pris une semaine à remarquer Une de mes URL avait une chaîne de requête avec un esperluette dedans - quelque chose comme ?id=1&sort=name- et je l'avais collé directement dans un <loc> étiquette. Google Search Console a signalé l'ensemble du sitemap comme invalide, mais le message d'erreur était suffisamment vague pour que je suppose que le problème était ailleurs. Ce n'était pas le cas. Un esperluette brute est illégale en XML ; il doit être écrit comme &amp;. Un personnage a cassé le fichier entier, et chaque page n'a pas été soumise pendant que je cherchais un problème que je ne comprenais pas.

Cette expérience a façonné la façon dont je pense aux plans de site, et finalement pourquoi j'ai ajouté un Générateur de sitemap XML à Toolz.dev. Un plan de site n'est pas conceptuellement difficile - c'est une liste d'URL enveloppées dans des balises - mais le format est impitoyable, et les parties qui font trébucher les gens sont exactement les parties qu'une machine devrait gérer : échapper aux caractères réservés, valider que chaque URL est absolue, attraper les doublons et rester sous les limites de taille de protocol&#39 ; entre l'exécution du référencement pour mes propres projets et la construction du plugin WordPress Administrer WP, j'ai généré plus de sitemaps que je ne peux en compter, et la même poignée d'erreurs se reproduisent à chaque fois. Ce guide vous explique ce qu'est réellement un sitemap, ce qui lui appartient et comment le générateur supprime les arêtes vives.

tl;dr : Un sitemap XML est une liste des URL importantes de votre site au format sitemaps.org, afin que les moteurs de recherche puissent les analyser efficacement. chacun <url> a besoin d'un <loc> et peut transporter en option <lastmod>, <changefreq>, et <priority> balises. Un seul fichier est plafonné à 50 000 URL et 50 Mo. le Générateur de sitemap XML prend une liste simple d'URL, les échappe correctement, supprime les doublons, avertit aux limites et produit un plan de site valide.xml que vous pouvez télécharger et soumettre - le tout dans votre navigateur.

Qu'est-ce qu'un sitemap XML et en ai-je besoin ?

Un sitemap XML est un fichier qui répertorie les URL de votre site que vous souhaitez connaître. Il suit une petite norme bien définie publiée sur Sitemaps.org et prise en charge par Google, Bing et tous les autres moteurs majeurs. Le fichier enveloppe chaque URL dans un <url> élément à l'intérieur d'un seul <urlset>, et déclare un espace de noms afin que les analyseurs sachent quelle version du protocole il parle.

Le plan de site valide minimal ressemble à ceci :

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/</loc>
  </url>
</urlset>

C'est toute la forme Tout le reste - dates, fréquences, priorités - est une décoration facultative au-dessus du seul élément requis, <loc>.

En avez-vous besoin ? Les moteurs de recherche trouvent des pages principalement en suivant des liens, donc un petit site bien lié est souvent découvert bien sans plan du site Mais un plan du site gagne sa garde dans plusieurs situations courantes : un grand site où les robots d'exploration pourraient ne pas atteindre chaque page dans un nombre raisonnable de sauts ; un nouveau site avec peu de liens externes pointant vers lui ; un site avec des pages qui ne sont pas bien connectées en interne, comme le contenu d'archives profondes ; ou un site qui change souvent et veut signaler la fraîcheur Un plan du site ne garantit pas l'indexation - c'est une invitation, pas une commande - mais il rend vos URL importantes faciles à trouver, et il vous donne un canal propre pour parler des pages Google pourrait manquer autrement.

Quelles informations sont indiquées dans chaque entrée d'URL ?

Au-delà de l'exigence <loc>, le protocole définit trois balises enfant facultatives, et il y a beaucoup de folklore quant à leur importance. Voici la version honnête.

<loc> est l'URL de la page Elle doit être absolue - en commençant par http:// ou https://- entièrement qualifié et échappé au XML. C'est l'étiquette dans laquelle vivait mon ancien bug d'esperluette, et le générateur échappe automatiquement aux cinq caractères spéciaux XML pour ne jamais l'atteindre.

<lastmod> La date de modification de la page est-elle la dernière fois, au format W3C DateTime : soit un simple 2026-07-25 ou un horodatage complet comme 2026-07-25T14:30:00+00:00. Celui-ci compte vraiment. Google a déclaré qu'il utilisait lastmod Comme un signal pour savoir quand réinventer une page, À condition que la valeur soit exacte et cohérente. Si vous tamponnez chaque page avec la date d'aujourd'hui sur chaque version, vous mentez au robot et il apprendra à vous ignorer. Utilisez une date de modification réelle.

<changefreq> indique la fréquence à laquelle la page change - always, hourly, daily, weekly, monthly, yearly, ou never. Google a clairement indiqué qu'il ignore largement cette balise, la traitant comme un indice faible au mieux. Cela ne fait aucun mal à inclure, mais ne vous agonisez pas.

<priority> est un nombre de 0,0 à 1,0 suggérant une importance de page par rapport à Autres pages sur votre propre site. Cela n'affecte pas votre classement par rapport à d'autres sites, et Google l'ignore également. L'erreur courante est de définir chaque page sur 1.0, ce qui rend la balise dénuée de sens. Si vous l'utilisez, réservez les valeurs élevées pour vos pages les plus importantes.

Le générateur vous permet de postuler changefreq, priority, et lastmod globalement à chaque URL, et omet proprement toute balise que vous laissez vide - donc si vous voulez un plan de site nu de juste <loc> Les entrées, qui sont un choix parfaitement valable et de plus en plus populaire, vous obtenez exactement cela.

Comment créer un fichier sitemap.xml ?

Le flux de travail est conçu pour être rapide et pour éliminer les erreurs de format qui affligent les sites de cartes de site écrites à la main.

Commencez par coller vos URL dans l'entrée, une par ligne. Vous pouvez coller une liste exportée à partir de votre CMS, une analyse ou une colonne de tableur. Les lignes vides sont ignorées et toute ligne commençant par # est traité comme un commentaire, vous pouvez donc annoter ou désactiver temporairement les URL sans les supprimer. Chaque ligne est exécutée via l'analyseur d'URL Whatwg : si ce n'est pas un objet valide et absolu http ou https URL, il est ignoré et signalé, de sorte qu'un chemin relatif parasite ou une faute de frappe ne corrompt jamais silencieusement la sortie.

Ensuite, définissez les valeurs par défaut Choisissez une fréquence de changement dans le dépôt, définissez une priorité si vous en souhaitez une et activez la date de dernière modification - elle est par défaut jusqu'à aujourd'hui mais vous pouvez choisir n'importe quelle date. Ensuite, décidez du nettoyage : activez la déduplication pour supprimer les URL répétées (par défaut, car dupliquer <loc> Les entrées sont un artefact de copier-coller courant) et trient éventuellement la liste par ordre alphabétique afin qu'il soit plus facile de numériser et de différer par rapport à une version précédente.

La sortie est mise à jour en direct lorsque vous changez quelque chose. Quand il semble correct, copiez le XML ou téléchargez-le directement comme sitemap.xml. L'outil indique également le nombre d'URL qui l'ont introduit, la taille du fichier, les lignes qu'il a ignorées et pourquoi - afin que vous obteniez un compte rendu clair de ce qui est entré exactement dans le fichier, et pas seulement d'un blob de XML auquel vous devez faire confiance.

Où puis-je mettre le sitemap et comment le soumettre ?

La génération du fichier est la moitié du travail, l'autre moitié en fait connaître les moteurs de recherche.

Premièrement, Téléchargez le sitemap.xml sur la racine de votre site Il est donc accessible à https://yoursite.com/sitemap.xml. L'emplacement compte plus que ce que les gens attendent : un sitemap ne peut contenir que des URL du même niveau de répertoire ou en dessous de son emplacement, alors le placer à la racine lui permet de couvrir l'ensemble du site. La plupart des hôtes et des plates-formes CMS vous permettent de déposer un fichier statique dans la racine Web, ou vous pouvez le servir à partir d'une route.

Deuxièmement, Soumettre l'URL du plan de site dans la console de recherche Google Sous Indexation → Plans du site et dans les outils de webmaster Bing sous la section Équivalente. Vous collez l'URL complète et le moteur la récupère, signale le nombre d'URL qu'il lis et signale les erreurs. C'est également là que vous verrez si Google a réellement indexé les pages, ce qui est distinct de savoir si il lisait le plan du site.

Troisièmement - et c’est l’étape que la plupart des gens sautent - Ajoutez une référence dans votre robots.txt. une seule ligne, Sitemap: https://yoursite.com/sitemap.xml, permet à tout crawler de découvrir automatiquement votre sitemap sans que vous le soumettiez n'importe où. C'est le mouvement de la ceinture et de l'accolade, et il se marie naturellement avec le Générateur robots.txt sur le site, qui peut produire ce fichier avec la ligne du plan de site déjà en place. Les deux outils sont conçus pour être utilisés ensemble : robots.txt indique aux robots d'exploration à quoi ils peuvent accéder et le plan de site leur indique ce qui existe.

Quelles sont les limites de taille et que se passe-t-il lorsque je les dépasse ?

Le protocole Sitemaps.org coiffe un seul fichier de plan de site à 50 000 URL et 50 Mo non compressés. Ce sont des limites strictes - un fichier qui enfreint l'une ou l'autre est rejeté - et elles existent afin que les analyseurs n'aient pas à charger des fichiers illimités en mémoire.

Pour la plupart des sites, il s'agit d'un non-problème, vous manquerez de pages bien avant de manquer de place. Mais les grands catalogues de commerce électronique, les archives d'actualités et les sites de contenu généré par les utilisateurs dépassent régulièrement 50 000 URL. Lorsque cela se produit, la réponse est une Index du plan de site: Vous divisez vos URL dans plusieurs fichiers de plan de site (chacun sous la limite) et créez un fichier d'index qui les répertorie. L'index utilise un <sitemapindex> emballage au lieu de <urlset>, et les moteurs de recherche récupèrent d'abord l'index, puis chaque plan de site enfant.

Le générateur compte vos URL et la taille des octets de la sortie au fur et à mesure que vous construisez, et vous avertit au moment où l'une ou l'autre limite est franchie, avec une note en langage clair vous indiquant de vous diviser en plusieurs fichiers derrière un index. Cette alerte précoce est délibérée - le pire moment pour découvrir que vous dépassez la limite est après avoir soumis un fichier que Search Console rejette ensuite. Connaître votre décompte au fur et à mesure transforme un échec en décision de planification.

Une comparaison : ce qui appartient à votre sitemap, et ce qui ne l'est pas

Un plan du site est une déclaration d'intention - &quot ; ce sont les pages canoniques que je veux indexées&quot ; - donc ce que vous laissez de côté est aussi important que ce que vous mettez. Le rembourrer de déchets envoie des signaux mitigés et peut diluer à quel point Google lui fait confiance.

inclure exclure
Pages canoniques et indexables que vous souhaitez classer URL en double ou non canonique
Pages de contenu et de catégories importantes Pages bloquées par robots.txt ou noindex
Nouvelles pages que vous souhaitez recragaz Redirection (3xx) et pages d'erreur (4xx/5xx)
Pages faiblement liées en interne URL avec des paramètres de suivi ou des ID de session

Le principe directeur est que chaque URL de votre plan de site doit retourner un statut 200, être canonique et être une page que vous seriez heureux de voir dans les résultats de recherche La liste d'une URL ne force pas Google à l'indexer, et la liste des pages que vous avez dit à Google d'ignorer ailleurs - via une balise noindex ou un bloc robots.txt - est contradictoire Un plan de site ciblé de vos meilleures pages surpasse systématiquement un vidage exhaustif de tout ce que le robot pourrait théoriquement atteindre.

Où se situe un générateur de sitemap dans une boîte à outils de référencement ?

Je construis Toolz.dev comme un ensemble connecté d'utilitaires plutôt qu'une pile de gadgets non liés, et les outils techniques de référencement sont conçus pour fonctionner en groupe. Le générateur de sitemap s'associe le plus directement avec le Générateur robots.txt- les deux fichiers sont la poignée de main standard entre votre site et un robot d'exploration, l'un indiquant ce qui peut être consulté et l'autre répertoriant ce qui existe. Au niveau de la page, le Générateur de balises Produit le titre, la description et les balises de graphes ouvertes qui déterminent la manière dont chacune de ces URL de plan de site s'affiche dans les résultats de recherche et les partages sociaux. Et lorsque vous construisez les URL elles-mêmes, le générateur de limace Transforme les titres de page en des chemins propres et lisibles qui font un bon sitemap en premier lieu.

Le fil de discussion les connectant est que chacun fait un travail précisément et localement, sans télécharger vos données Ce dernier point n'est pas accessoire pour un outil de plan de site : votre liste d'URL est en fait une carte de toute la structure de votre site, y compris les pages que vous n'avez peut-être pas encore lancées, et il ne doit pas être envoyé à un serveur tiers juste pour être enveloppé dans des balises Tout ici fonctionne dans votre navigateur, ce qui le rend sûr à utiliser sur les sites de mise en scène et le travail client sous NDA - une position de confidentialité que j'ai écrit longuement dans le guide sur Garder vos données privées avec des outils côté client. C'est la même philosophie de construction que j'apporte à chaque utilitaire du site, que j'ai déballé dans le Guide d'outils pour les développeurs Web: Les petits outils pointus et honnêtes battent les plates-formes tout-en-un gonflées qui veulent que vos données soient le prix d'admission.

Erreurs courantes lors de la création d'un sitemap

Les erreurs récurrentes méritent d'être nommées afin que vous puissiez les éviter. Premièrement, Caractères spéciaux non échappés- le bug d'esperluette avec lequel j'ai ouvert. Brut &, <, et > Les caractères d'une URL cassent le XML. Le générateur échappe automatiquement aux cinq caractères réservés, mais si vous modifiez le fichier à la main, gardez-le à l'esprit.

Deuxièmement, URL relatives ou relatives au protocole. un <loc> doit être absolu et inclure le schéma. /about ou //example.com/about sont tous deux invalides ; seuls https://example.com/about fonctionne. L'outil rejette et signale tout ce qui n'est pas une URL absolue appropriée plutôt que de le transmettre.

Troisièmement, Y compris les URL non canoniques ou non indexables- redirections, pages non indexées ou doublons avec paramètres de suivi. Ceux-ci envoient des signaux contradictoires et gaspillent le budget d'exploration. Conservez le plan du site sur les pages canoniques de 200 statuts.

Quatrièmement, rassis ou malhonnête lastmod dates. L'estampage de chaque page avec la date actuelle de chaque déploiement apprend à Google à se méfier entièrement de la balise. Utilisez des dates de modification réelles ou partez lastmod éteint plutôt que de le faire semblant.

Cinquième, Oublier de soumettre à nouveau ou de référencer le plan du site. Générer le fichier ne fait rien en soi : vous devez le télécharger, le soumettre dans Search Console et idéalement le pointer depuis robots.txt. Un plan du site situé sur votre serveur dont aucun robot n'a été informé n'est qu'un fichier.

Questions fréquentes

Qu'est-ce qu'un sitemap XML ?

Un sitemap XML est un fichier qui répertorie les URL importantes sur votre site afin que les moteurs de recherche puissent les trouver et les analyser efficacement. Il suit le protocole Sitemaps.org, enveloppant chaque URL dans un <url> Élément avec une date de modification de dernière option, une fréquence de modification et une priorité. En soumettre un aide les moteurs de recherche à découvrir des pages qui ne sont pas bien liées en interne.

Comment créer un fichier sitemap.xml ?

Collez les URL de votre site dans ce générateur, une par ligne, définissez la fréquence de modification et la priorité souhaitée, puis copiez ou téléchargez le résultat en tant que sitemap.xml. Téléchargez ce fichier dans le répertoire racine de votre site Web afin qu'il vivait à https://yoursite.com/sitemap.xml, et soumettez son URL dans la console de recherche Google. L'ensemble du processus prend quelques minutes.

Que font réellement ChangeFreq et Priority ?

changefreq laisse entendre à quelle fréquence une page change et la priorité (0.0 à 1.0) suggère son importance par rapport aux autres pages de votre site Les deux sont des indices, pas des commandes - Google a dit qu'il les ignore largement et s'appuie sur ses propres signaux Ils ne font aucun mal, alors définissez changefreq à peu près et réservez la priorité 1.0 pour vos pages les plus importantes.

Combien d'URL peut contenir un sitemap ?

Un seul fichier de plan de site est limité à 50 000 URL et 50 Mo non compressés. Si votre site est plus grand, divisez les URL entre plusieurs fichiers de plan de site et répertoriez ces fichiers dans un index de plan de site. Cet outil vous avertit dès que l'une ou l'autre limite est franchie afin que vous sachiez quand casser le fichier.

Dans quel format la date LastMod doit-elle être ?

Utilisez le format W3C DateTime : soit une date simple comme le 2026-07-25, soit un horodatage complet comme 2026-07-25T14:30:00 + 00:00. Ce générateur accepte les deux et par défaut la date d'aujourd'hui lorsque vous activez LastMod sans en saisir un. Les valeurs précises de LastMod aident les moteurs de recherche à donner la priorité aux pages de recrudescence qui ont vraiment changé.

Dois-je inclure chaque page dans mon sitemap ?

Incluez les pages canoniques et indexables que vous souhaitez classer et laissez de côté les doublons, les redirections, les pages d'erreurs et tout ce qui est bloqué par robots.txt ou une balise NoIndex. La liste d'une URL ne garantit pas l'indexation et le remplissage du fichier avec des URL de faible valeur envoie des signaux mitigés. Un plan de site ciblé de vos meilleures pages fonctionne mieux qu'un plan exhaustif.

Où dois-je soumettre mon sitemap après l'avoir généré ?

Téléchargez Sitemap.xml sur la racine de votre site, puis soumettez son URL complète dans la console de recherche Google sous Indexation → Plans du site et dans les outils de webmaster Bing. Vous pouvez également ajouter un "Sitemap : https://yoursite.com/sitemap.xml"Ligne vers votre fichier robots.txt afin que tout crawler puisse le découvrir automatiquement.

Ma liste d'URL est-elle privée ?

Oui. L'intégralité du plan du site est construite dans votre navigateur avec du JavaScript simple. Vos URL - qui peuvent exposer l'ensemble de la structure de votre site - ne sont jamais transmises, enregistrées ou stockées, et l'outil continue de fonctionner sans connexion réseau une fois la page chargée.

Frequently Asked Questions

An XML sitemap is a file that lists the important URLs on your site so search engines can find and crawl them efficiently. It follows the sitemaps.org protocol, wrapping each URL in a url element with an optional last-modified date, change frequency, and priority. Submitting one helps search engines discover pages that are not well linked internally.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!