Command Palette

Search for a command to run...

Extracteur de courrier électronique : retirez proprement chaque adresse du texte désordonné

Extracteur de courrier électronique : retirez proprement chaque adresse du texte désordonné

T
Toolz Team
|Aug 23, 2026|16 min Lire

Fait partie de la collection regex

Le travail qui m'a fait construire cela est arrivé comme une chaîne de messagerie transmise de quarante messages de profondeur Un client voulait une seule liste de toutes les personnes qui avaient été copiées sur un fil de six mois afin qu'elles puissent migrer le groupe vers une liste de diffusion appropriée Chaque adresse était là, enterrée dans To: et Cc: lignes, en signatures, en réponses citées, parfois trois fois Plus Défiler et copier à la main allait prendre un après-midi et j'en raterais encore quelques-uns et en dupliquerais quelques autres Ce dont j'avais réellement besoin, c'était quelque chose qui lirait toute la goutte de texte, trouverait chaque adresse e-mail dedans, jetter les doublons, et me remettrait une liste propre C'est le extracteur d'email« , et ce guide explique comment cela fonctionne et pourquoi les détails ennuyeux de la correspondance sont importants. ».

tl;dr : Un extracteur de courriel scanne un bloc de texte et retire chaque adresse de courriel qu'il contient, renvoyant une liste dé-dupliquée que vous pouvez copier L'outil Toolz va plus loin, extrayant les URL, les numéros de téléphone et les adresses IPv4 du même texte avec le même moteur Il correspond aux expressions régulières organisées, s'effondre les doublons de manière insensible à la casse et peut trier et réduire la casse de la sortie Tout s'exécute côté client : pas de téléchargement, pas d'inscription, fonctionne hors ligne.

Je construis des produits SaaS sur Laravel et React et je livre des plugins WordPress, et une quantité surprenante de ce travail consiste à transformer du texte non structuré en listes structurées Une exportation de boîte de réception de support, une page grattée, un fichier journal, un document collé : ils mélangent tous les données que vous voulez avec du bruit autour de lui Tirer les adresses, liens ou IP de ce bruit est une petite tâche que vous faites constamment, et le faire avec une expression régulière vous vous rappelez à moitié et retapez chaque fois est exactement la friction qu'un outil de navigateur devrait supprimer C'est donc le guide que j'aurais aimé avoir l'après-midi où la chaîne de quarante messages a atterri sur mes genoux.

Qu'est-ce qu'un extracteur de courriel ?

Un extracteur de courriel est un outil qui lit du texte libre et renvoie chaque adresse de courriel à l'intérieur comme une liste Vous collez un bloc de texte, qu'il s'agisse d'un fil de courriel, d'une page Web, d'un vidage CSV, d'un journal de discussion ou d'une page de code source, et l'outil trouve chaque adresse à l'aide d'un modèle qui reconnaît la forme d'un courriel : une partie locale, un signe at et un domaine se terminant par un domaine valide de premier niveau Au lieu de lire le texte vous-même et de copier les adresses une à la fois, vous obtenez l'ensemble à la fois, avec les doublons supprimés.

Les Toolz extracteur d'email C'est délibérément plus que des emails Le même moteur de numérisation peut extraire des URL, des numéros de téléphone et des adresses IPv4 http et https, car il s'agit de la même classe de problème : trouvez chaque occurrence d'un motif connu dans un mur de texte et répertoriez-le proprement Cela en fait un utilitaire d'extraction général plutôt qu'un outil à simple tour L'idée de base est constante sur les quatre types Définissez un modèle précis pour ce à quoi ressemble une correspondance valide, scannez le texte pour chaque occurrence ne se chevauchant pas, puis nettoyez, dédupliquez et éventuellement triez les résultats dans une liste que vous pouvez coller partout où vous en avez besoin.

Pourquoi ne pas simplement le regarder ou utiliser la recherche dans la page ?

Parce que les deux méthodes échouent de la manière qui compte le plus La lecture du texte et la copie des adresses à la main sont lentes, et pire, ce n'est pas fiable : vous manquez l'adresse rentrée à l'intérieur d'un bloc de signature, vous copiez deux fois la même d'une réponse citée, et vous n'avez aucun moyen de savoir combien vous auriez dû vous retrouver Plus l'entrée est grande, plus les chances sont mauvaises, et les entrées qui doivent être extraites sont généralement les plus grandes.

La recherche de navigateur dans la page n'est pas meilleure pour cela Elle met en évidence les correspondances pour une chaîne que vous connaissez déjà, mais tout le point d'extraction est que vous ne connaissez pas les adresses à l'avance, donc il n'y a rien à rechercher Ce dont vous avez besoin est un motif qui correspond à la forme d'un email quelles que soient ses lettres exactes, ce qui est précisément ce que fournit une expression régulière Écrire correctement cette expression est sa propre petite compétence, et se tromper légèrement signifie soit manquer des adresses valides, soit attraper des déchets qui ne ressemblent qu'à un. Un extracteur dédié prépare un motif testé afin que vous n'ayez jamais à le retaper, et le associe à une déduplication afin que la liste que vous copiez soit la liste à laquelle vous pouvez faire confiance. Si vous voulez ajuster le motif testeur de regex vous permet de coller votre propre expression et de la regarder correspondre à un exemple de texte en temps réel.

Quelle est la précision de la correspondance des e-mails ?

C'est la question qui décide si un extracteur est utile ou gênant, il vaut donc la peine d'être précis Le format de l'adresse e-mail est défini par RFC 5322[TRADUCTION] ?, et la grammaire complète est notoirement baroque Elle permet de citer des parties locales avec des espaces, des commentaires entre parenthèses et d'autres formes qui sont techniquement valides et n'apparaissent jamais une seule fois dans des données réelles Une expression régulière qui essaie de correspondre à l'ensemble de la RFC est énorme, et en pratique, elle fait plus de mal que de bien, car elle commence à faire correspondre des chaînes qu'aucun serveur de messagerie n'accepterait jamais.

L'extracteur Toolz utilise le sous-ensemble pragmatique sur lequel l'industrie s'est installée : une partie locale de lettres, de chiffres et la ponctuation commune, un signe at et un domaine en pointillés qui se termine par un domaine de niveau supérieur d'au moins deux lettres. C'est la même forme que la plupart des bibliothèques de validation utilisent, et cela correspond aux adresses que les gens ont réellement en rejetant le bruit. C'est un commerce délibéré. Vous renoncez à faire correspondre les formes exotiques qui ne se produisent pas afin d'éviter les faux positifs sur les formulaires qui ressemblent à des e-mails mais ne valent pas. Pour extraire des adresses de documents réels, ce qui est intentionnellement le travail, l'outil est honnête à ce sujet aussi : le même moment s'applique aux numéros de téléphone, où il n'est pas le modèle global, il y a un numéro de lecture

Comment puis-je extraire des e-mails du texte avec l'outil ?

Le flux prend environ dix secondes Collez votre texte dans la zone de saisie, ou cliquez sur Charger l'échantillon pour voir un exemple travaillé qui contient des e-mails, des URL, des numéros de téléphone et des adresses IP, tous mélangés.

Choisissez ce qu'il faut extraire en utilisant la rangée de boutons en haut : adresses e-mail, URL, numéros de téléphone, adresses IPv4 ou numéros L'outil applique le modèle de correspondance pour ce type et ignore tout le reste Ensuite, définissez les options de Leave &quot ; Supprimez les doublons&quot ; on pour réduire les correspondances répétées en une seule entrée, ce qui est presque toujours ce que vous voulez Activez &quot ; Trier&quot ; pour classer la liste par ordre alphabétique, ou par valeur lorsque vous extrayez des numéros Activez &quot ; Basse-case&quot ; pour normaliser les e-mails et URL ainsi [email protected] et [email protected] sont traités comme une seule adresse Choisissez comment les résultats sont joints : nouvelle ligne pour une liste verticale, virgule pour une cellule CSV ou a To: champ, espace ou point-virgule pour les clients de messagerie qui s'y attendent.

Cliquez sur Extraire et les résultats apparaissent avec un compte du nombre de correspondances trouvées et du nombre de doublons supprimés Copiez la liste et collez-la partout où elle doit aller C'est toute la boucle, et comme elle s'exécute instantanément vous pouvez basculer entre les types d'extraction sur le même texte pour tirer des emails, puis des URL, puis des IP, sans rien re-coller.

Que puis-je extraire, et quand utiliserais-je chacun ?

Les quatre types d'extraction couvrent les données qui se cachent le plus souvent à l'intérieur du texte Voici ce que chacun correspond et la situation à laquelle il sert.

taper à la allumette Usage typique
Adresses courriel [email protected] dans le sous-ensemble pratique RFC Construire une liste de diffusion à partir d'un thread, extraire les contacts d'une exportation
URL http:// et https:// liens, ponctuation arrière coupée Collecte de chaque lien à partir d'une page ou d'un document à des fins d'audit
Numéros de téléphone Exécute plus de 7 chiffres avec des espaces, des tirets, des points ou des parenthèses Rassemblement des numéros de contact à partir de texte gratté ou collé
Adresses IPv4 Quads pointillés avec chaque octet limité à 0-255 Extraire des adresses d'un fichier journal ou d'un vidage de configuration
nombres Entiers et décimales signés, avec des milliers de séparateurs Extraire des chiffres d'un rapport ou d'un tableau collé sous forme de texte

Les types de courriel et d'URL sont ceux que j'atteins pour la plupart, généralement ensemble : extraire les courriels pour construire une liste de contacts, puis passer aux URL pour auditer chaque lien les mêmes références de documents Le type IPv4 gagne sa place lorsque je lis les journaux du serveur et que je veux l'ensemble unique d'adresses qui frappent un point de terminaison, qui se marie naturellement avec le Analyseur d'URL lorsque je dois ensuite décomposer ces demandes davantage, le type de numéro est le plus étrange mais véritablement pratique pour extraire des chiffres d'un rapport collé sous forme de texte brut au lieu d'une feuille de calcul. Quelle que soit la sélection choisie, les options de déduplication et de tri fonctionnent de la même manière, de sorte que la sortie est toujours une liste propre et ordonnée plutôt que des correspondances brutes.

Comment la déduplication fonctionne-t-elle réellement ici ?

La déduplication semble triviale jusqu'à ce que vous envisagiez le casing La même personne&#39 ; s adresse peut apparaître comme [email protected] en une signature et [email protected] dans une réponse citée, et un dé-duplicata naïf qui compare exactement les chaînes garderait les deux C'est faux : les parties locales de courrier électronique sont insensibles à la casse dans chaque système de messagerie pratique, et les domaines sont insensibles à la casse par définition L'extracteur compare donc les e-mails et les URL de manière insensible au moment de décider si deux correspondances sont identiques, ce qui signifie que ces deux orthographes s'effondrent en une seule entrée même si vous n'avez pas activé l'option minuscule.

L'outil vous indique également ce qu'il a fait Le compte au-dessus des résultats montre à la fois combien de correspondances il a trouvé au total et combien de doublons il a supprimé, donc vous ne devinez jamais si la liste a rétréci à cause de la dé-duplication ou parce que l'entrée était plus petite que vous pensiez Pour les nombres et les adresses IP, où le casse n'est pas pertinent, la comparaison est exacte C'est le genre de détail qui est invisible quand il fonctionne et exaspérant quand il ne fonctionne pas, c'est pourquoi il vaut la peine de se rétablir plutôt que de partir dans une plaine Set de chaînes brutes Si votre travail consiste vraiment à savoir quelles valeurs apparaissent dans une liste mais pas dans une autre plutôt que de les sortir de la prose, le outil de comparaison de deux listes définit l'arithmétique sur les colonnes et convient mieux à cette question spécifique.

Est-il sécuritaire d'extraire du texte sensible en ligne ?

Pour cet outil, oui, et la raison est comment il est construit plutôt qu'une politique que vous devez prendre sur la foi Le texte que vous collez est scanné entièrement dans votre propre navigateur avec JavaScript Il n'y a pas de téléchargement, pas de serveur aller-retour, et rien n'est enregistré ou stocké Vous pouvez le confirmer en ouvrant votre navigateur&#39 ; s onglet réseau et en cliquant sur Extraire : aucune requête ne quitte la page Une fois la page chargée vous pouvez aller hors ligne et elle continue de fonctionner.

Cela compte plus pour l'extraction que pour presque tout autre type d'outil, car le texte que vous collez est souvent rempli exactement des données que vous ne voudriez pas divulguer. Les threads de messagerie contiennent des adresses privées, les fichiers journaux contiennent des adresses IP internes et des noms d'hôte, et les documents collés contiennent des numéros de téléphone et des noms. Un extracteur qui télécharge ce texte sur un serveur pour le traiter, aussi bien intentionné soit-il, transforme votre correspondance privée en quelqu'un d'autre et n°39 ; le journal du serveur. Le traitement côté client supprime le risque à la racine : le texte ne quitte jamais votre machine. Ce défaut est délibéré sur chaque outil sur Toolz.dev, et j'ai exposé l'argument complet dans le guide de confidentialité des données pour les outils en ligne si vous voulez le raisonnement en profondeur Pour un regard plus large sur la façon dont ces petits utilitaires s'emboîtent dans un kit de travail, mon Guide des outils de productivité des développeurs marche à travers les morceaux.

Quelles sont les limites à connaître ?

Être droit sur les limites fait partie de la confiance à un outil, donc voici les bords honnêtes Le modèle de courriel correspond au sous-ensemble pratique de la RFC 5322, pas la grammaire complète, donc une adresse techniquement valide mais exotique avec une partie locale citée ou un commentaire sera manqué C'est un choix délibéré pour éviter les faux positifs, et il n'affecte essentiellement pas l'adresse réelle, mais c'est une limite et vous devriez savoir qu'il existe Les numéros de téléphone sont les plus lâches des cinq types, parce qu'il n'y a pas de format universel ; le modèle recherche une série de sept chiffres ou plus avec des séparateurs communs, ce qui signifie qu'il peut occasionnellement attraper un long identifiant qui n'est pas un numéro de téléphone, donc un coup d'il vaut le second.

L'extracteur fonctionne également sur du texte, pas sur des fichiers binaires Si vous avez un PDF ou un document Word, copiez son texte et collez-le ; l'outil ne peut pas lire le format de fichier lui-même Et comme tout s'exécute dans la mémoire du navigateur, une entrée véritablement énorme sera limitée par votre navigateur plutôt que par l'outil, bien que pour les e-mails, les liens et les IP les gens extraient en fait ce plafond est bien au-dessus de ce que vous allez atteindre Aucune de ces limites ne mordent dans une utilisation normale Les connaître est juste la différence entre utiliser l'outil avec confiance et être surpris par un cas de bord.

Questions fréquentes

Comment puis-je extraire les adresses e-mail du texte ? Collez le texte dans le extracteur d'email et laissez le type défini aux adresses e-mail Il analyse le texte avec un modèle de messagerie, répertorie chaque adresse qu'il trouve, supprime les doublons et vous permet de copier la liste propre Aucune inscription ou téléchargement n'est nécessaire, et il fonctionne hors ligne une fois chargé.

Peut-il extraire des URL et des numéros de téléphone aussi ? Oui. Basculez le type d'extraction sur des URL, des numéros de téléphone, des adresses IPv4 ou des numéros. Le même moteur applique un modèle différent pour chaque type, donc un outil gère plusieurs tâches d'extraction du même bloc de texte sans le re-coller.

Enlève-t-il les courriels en double ? Oui, lorsque l'option supprimer les doublons est activée Les correspondances répétées s'effondrent en une seule entrée, et l'outil indique combien de doublons ont été supprimés Les e-mails et les URL correspondent de manière insensible à la casse, de sorte que la même adresse dans le casse de lettres différent est traitée comme une seule.

Quelle est la précision de la correspondance des e-mails ? Le modèle correspond au sous-ensemble pratique d'adresses e-mail vu dans les données réelles : une partie locale, un signe at et un domaine en pointillés se terminant par un domaine de premier niveau valide Il n'implémente pas la grammaire RFC 5322 complète, qui permet des formes exotiques qui n'apparaissent jamais dans la pratique et produiraient de fausses correspondances sur des chaînes qui ne ressemblent qu'à des e-mails.

Pourquoi certains numéros de téléphone correspondent-ils bizarrement ? Les numéros de téléphone n'ont pas de format global unique, donc le modèle recherche une série de sept chiffres ou plus avec des espaces, des tirets, des points ou des parenthèses entre eux. Ceci est délibérément large, ce qui signifie qu'il peut occasionnellement attraper un numéro long qui n'est pas un numéro de téléphone, il vaut donc la peine de revoir les résultats lors de l'extraction de numéros de téléphone à partir de texte mélangé.

Puis-je trier la liste extraite ? Oui. Activez l'option de tri pour classer la liste par ordre alphabétique ou par valeur numérique lors de l'extraction des nombres. Combinez-le avec l'option supprimer les doublons pour obtenir une liste propre, ordonnée et sans doublon, prête à être copiée.

Dans quels formats puis-je copier les résultats ? Vous pouvez joindre les correspondances avec une nouvelle ligne, une nouvelle virgule, un espace ou un point-virgule Choisissez une nouvelle ligne pour une liste verticale, une virgule pour une cellule CSV ou un champ To et un point-virgule pour certains clients de messagerie. Le compte au-dessus de la sortie indique combien de correspondances ont été extraites.

Les données extraites sont-elles téléchargées n'importe où ? Non. Le texte est analysé localement dans votre navigateur avec JavaScript Rien n'est transmis, enregistré ou stocké, et l'outil continue de fonctionner hors ligne une fois chargé, ce que vous pouvez confirmer en regardant l'onglet réseau pendant que vous extrayez.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!