Aller au contenu
Vérification en direct · récupère votre URL côté serveur

URL Extractor

Extrayez toutes les URL de n'importe quel texte, fichier journal, e-mail ou page web en un clic.

Un URL Extractor scanne n'importe quel bloc de texte, fichier journal, export JSON, corps d'email ou HTML brut et en extrait tous les liens qu'il trouve. Cet outil exécute une regex sur ce que vous collez, valide chaque correspondance avec le parser URL du navigateur, supprime la ponctuation finale comme les virgules et les points, déduplique les résultats et les regroupe par host. Filtrez la sortie pour afficher toutes les URL, HTTP/HTTPS uniquement, ou masquez les liens du même domaine. Pas d'inscription, pas d'upload, tout reste dans votre navigateur.

or

Dominate AI Search Using a Proven System

BlazeHive runs the whole system for you - finds the keywords buyers actually search, writes the pages end to end, and publishes them so you show up in Google and in AI answers. Free trial, no card.

Start with BlazeHive Free trial

Ce que cet extracteur d'URL extrait du texte brut

L'extracteur correspond aux modèles http, https, ftp, mailto, et www. nu à l'intérieur de n'importe quelle entrée que vous lui fournissez. Cela couvre 95 % des liens du monde réel trouvés dans les journaux serveur, les e-mails d'assistance client, les threads de chat exportés et les articles collés. Les références nues www.example.com sont normalisées en https://www.example.com avant la validation afin qu'elles survivent à l'étape d'analyse. La ponctuation finale qui s'attache souvent aux URL en prose, comme )., ,, ; et ], est supprimée avant que le lien soit stocké.

Après l'extraction, chaque candidat passe par new URL(). Tout ce qui échoue au parsing est supprimé. Cela capture les chaînes mal formées comme https:// sans host ou http://example sans TLD. La liste propre est ensuite dédupliquée et triée par host afin que vous puissiez voir quels domaines apparaissent le plus souvent. Un journal d'accès nginx de 4 000 lignes avec 12 000 correspondances brutes se réduit généralement à 80-200 URL uniques après la déduplication.

Comment utiliser cet extracteur d'URL

  1. Entrez une URL ou collez du texte/HTML. Déposez un journal serveur, une charge JSON, un export d'email, un paragraphe en prose ou une source HTML brute. Vous pouvez aussi entrer une URL dans le champ ci-dessus et cliquer sur Fetch pour charger directement le HTML de cette page.
  2. Choisissez Filtre. Sélectionnez Toutes les URL pour voir tout, HTTP/HTTPS uniquement pour ignorer les correspondances mailto et ftp, ou Masquer le même domaine pour supprimer les liens pointant vers le host de la page source.
  3. Cliquez sur Extraire les URL. L'outil retourne une liste dédupliquée regroupée par host, avec un compte à côté de chaque domaine et une option de copie/téléchargement pour la sortie propre.

Essayez ceci avec un journal webhook Stripe. Collez 200 lignes contenant des références comme https://api.stripe.com/v1/charges/ch_3O2, https://yourapp.com/webhooks/stripe et mailto:[email protected]. Définissez Filtre sur HTTP/HTTPS uniquement. L'extracteur retourne trois URL uniques regroupées sous deux hosts : api.stripe.com (1 lien) et yourapp.com (1 lien). La correspondance mailto est masquée. Basculez Filtre sur Toutes les URL et la correspondance mailto réapparaît dans son propre groupe.

Pourquoi un extracteur d'URL basé sur le texte surpasse le parsing DOM pour les entrées désordonnées

La plupart des extracteurs de lien nécessitent un HTML valide et analysent le DOM pour trouver les balises <a href>. Cela fonctionne pour les pages web propres mais échoue sur les fichiers journaux, JSON, texte brut et HTML cassé où les ancres sont manquantes ou mal formées. Un extracteur d'URL basé sur regex lit les bytes bruts et trouve tout ce qui ressemble à une URL, indépendamment de la structure. Cela le rend adapté aux audits de sécurité, au triage des tickets d'assistance, aux migrations de contenu et à tout scénario où l'entrée n'est pas une page web rendue.

Si vous avez besoin du texte d'ancrage, des drapeaux nofollow ou de la classification interne/externe d'une véritable page web, utilisez plutôt l'extracteur de lien. Cet outil récupère l'URL, analyse le DOM avec DOMParser, et retourne des métadonnées d'ancrage structurées. Utilisez l'extracteur d'URL quand l'entrée est non structurée. Utilisez l'extracteur de lien quand l'entrée est HTML et que vous voulez le contexte de l'ancrage.

Erreurs courantes

  • Confondre extracteur d'URL avec extracteur de lien. L'extracteur d'URL lit n'importe quel texte et exécute une regex. L'extracteur de lien analyse l'HTML et lit les balises <a>. Utilisez l'extracteur d'URL pour les journaux, JSON et prose. Utilisez l'extracteur de lien pour analyser la structure des liens d'une page web en direct.
  • Oublier de supprimer les paramètres de requête avant la déduplication pour l'analytique. Deux URL qui diffèrent uniquement par ?utm_source= comptent comme des entrées distinctes. Si vous voulez des pages uniques, exécutez la sortie via une passage rapide en feuille de calcul pour supprimer les chaînes de requête avant le comptage.
  • Coller du HTML tronqué et en manquer la moitié des liens. Copier-coller depuis « View Page Source » tronque parfois à 100 KB ou coupe au milieu d'une balise. Utilisez plutôt l'option de récupération d'URL dans le champ ci-dessus, qui récupère la réponse serveur complète.
  • Faire confiance au compte de déduplication comme count de page unique. La déduplication est host plus path plus query. example.com/page et example.com/page/ sont deux entrées même si elles résolvent vers la même page. Normalisez les slashes finaux si l'unicité exacte importe.
  • Exécuter l'extracteur sur un fichier journal de 50 Mo en une seule pâte. La regex du navigateur sur des entrées énormes peut bloquer l'onglet pendant 30+ secondes. Divisez les journaux en chunks de 5 MB ou utilisez le mode fetch pour les URL individuelles.

Conseils avancés

  • Après l'extraction, canalisez la sortie dans l'extracteur de lien par URL pour obtenir le texte d'ancrage et les attributs rel pour chaque lien. Les deux outils s'enchaînent naturellement pour des audits de lien complets.
  • Pour les migrations SEO, extrayez chaque URL de votre ancien sitemap.xml, exécutez la même extraction sur le nouveau sitemap, et comparez les listes pour trouver les pages manquantes. Un site de 5 000 URL a généralement 50-200 redirections manquantes après une refonte.
  • Utilisez le filtre Masquer le même domaine lors de l'audit des liens sortants d'une seule page. Un site marketing B2B avec 80 liens internes et 12 liens externes partenaires montre seulement les 12 externes, rendant l'audit partenaire instantané.
  • Associez ceci à l'extracteur d'email lors du traitement de dumps de contacts. L'extracteur d'email capture les adresses que la regex mailto de l'extracteur d'URL manque, comme les chaînes nues [email protected] sans le préfixe mailto:.
  • Pour les workflows de développeur, exécutez l'extraction sur la sortie git log pour trouver chaque référence externe dans les messages de commit. Un historique de 2 000 commits contient généralement 40-80 URL de référence unique (tickets Jira, PR GitHub, threads Slack).

Une fois que vous avez une liste d'URL propre, l'étape suivante dépend de votre objectif. Pour l'audit de lien HTML avec contexte d'ancrage, exécutez chaque URL via l'extracteur de lien. Pour trouver les infos de contact dans la même entrée, utilisez l'extracteur d'email et l'extracteur de numéro de téléphone sur la même pâte. Pour les crawls basés sur sitemap, le vérificateur de sitemap vous donne la vue XML structurée que l'approche regex omet.

Dominate AI Search Using a Proven System

BlazeHive runs the whole system for you - finds the keywords buyers actually search, writes the pages end to end, and publishes them so you show up in Google and in AI answers. Free trial, no card.

Start with BlazeHive Free trial

Questions fréquemment posées

Qu'est-ce qu'un extracteur d'URL ?

Un extracteur d'URL est un outil qui scanne n'importe quelle entrée de texte et en extrait chaque URL qu'elle contient. Il utilise une expression régulière pour trouver les modèles commençant par http, https, ftp, mailto, ou www., puis valide chaque correspondance contre le parser URL du navigateur pour supprimer les chaînes mal formées. Après la validation, l'outil déduplique la liste et regroupe les résultats par host. Cet extracteur BlazeHive gère les fichiers journaux de 4 000 lignes, les charges JSON jusqu'à quelques mégaoctets, le HTML brut et la prose collée sans rien uploader vers un serveur. Tout s'exécute dans le navigateur. Les cas d'usage courants incluent le triage des journaux de sécurité, l'examen des tickets d'assistance, les audits de migration de contenu et la recherche concurrentielle rapide sur les liens sortants d'un article concurrent. Utilisez l'extracteur de lien quand vous avez spécifiquement besoin du texte d'ancrage et des drapeaux nofollow d'une page web en direct à la place.

Comment extraire des URL du texte ?

Collez votre texte dans le champ URL ou coller du texte/HTML, choisissez un filtre et cliquez sur Extraire les URL. L'outil exécute un modèle regex sur votre entrée qui correspond aux chaînes http://, https://, ftp://, mailto: et nues www.. Chaque correspondance passe par new URL() pour filtrer les candidats mal formés, puis la ponctuation finale comme les virgules, les points, les parenthèses et les crochets est supprimée. La liste dédupliquée regroupe par host et affiche un compte pour chaque domaine. Un thread d'email de 200 lignes produit généralement 5-15 URL uniques en moins d'une seconde. Pour l'extraction programmatique, le même modèle regex fonctionne en Python (re.findall), JavaScript (String.prototype.matchAll), ou grep avec le flag -oE, mais un outil de navigateur vous donne le filtrage instantané et le regroupement par host qu'une commande d'une ligne ne fait pas.

Puis-je extraire des URL d'un fichier journal ?

Oui. Les journaux serveur sont l'une des entrées les plus courantes pour cet extracteur d'URL. Collez jusqu'à quelques mégaoctets de lignes de journal nginx, Apache ou application dans la textarea et cliquez sur Extraire les URL. L'outil trouve chaque URL référencée dans le journal, déduplique et regroupe par host. Un journal d'accès nginx de 4 000 lignes avec 12 000 correspondances brutes se réduit généralement à 80-200 URL uniques après la déduplication. Pour les fichiers plus grands que 5 MB, divisez le journal en chunks avant de le coller. Si vous devez extraire des URL des journaux dans le cadre d'un workflow automatisé, le même modèle regex fonctionne dans grep -oE sur la ligne de commande. Utilisez l'outil de navigateur quand vous voulez un regroupement visuel rapide. Utilisez grep quand vous voulez canaliser la sortie dans un autre script. Après l'extraction, exécutez les hosts externes suspects via l'extracteur de lien pour inspecter le contenu de la page réelle.

Comment extraire des URL d'un PDF ?

L'extracteur d'URL fonctionne sur du texte, donc convertissez d'abord le PDF en texte. Sur macOS, exécutez pdftotext input.pdf output.txt depuis la ligne de commande (installez via brew install poppler). Sur Windows ou Linux, utilisez le même utilitaire pdftotext du package Poppler. Ouvrez le fichier texte résultant, copiez le contenu et collez-le dans le champ URL ou coller du texte/HTML. Les PDF créés à partir de pages web contiennent généralement 20-100 URL. Les PDF de documents natifs comme les rapports en contiennent généralement 5-20. L'extracteur capture les URL qui s'étendent sur les sauts de ligne si le PDF les préserve comme des chaînes continues. Attention aux PDF qui enroulent les longues URL sur plusieurs lignes avec des tirets. Celles-ci deviennent deux URL cassées. Si votre sortie semble suspecte, ouvrez le PDF dans Preview ou Adobe Reader et utilisez l'export « Save as Text » intégré, qui préserve mieux la continuité de l'URL que les outils en ligne de commande pour certains PDF.

Comment extraire des URL d'un email ?

Ouvrez l'email, affichez la source brute ou « Afficher l'original » (Gmail) ou « Afficher la source » (Outlook), et copiez le corps HTML complet. Collez-le dans le champ URL ou coller du texte/HTML et cliquez sur Extraire les URL. Un email marketing typique contient 15-40 URL incluant les pixels de suivi, les liens de désinscription, les icônes de réseaux sociaux et les liens de contenu. Choisissez le filtre HTTP/HTTPS uniquement pour ignorer l'adresse mailto: de réponse. Pour Apple Mail ou Thunderbird, vous pouvez copier directement l'email rendu sans voir la source, mais vous manquerez les URL masquées dans les attributs alt d'image et les pixels de suivi. Affichez la source pour l'extraction la plus complète. Si vous traitez les emails en masse, exportez votre boîte de réception au format mbox et exécutez le fichier via l'extracteur en chunks. La même regex capture les URL dans les corps d'emails en texte brut et HTML de manière égale.

Comment l'extracteur d'URL valide-t-il les URL ?

Chaque correspondance regex passe par le constructeur new URL() de JavaScript. Si le constructeur lève une exception, le candidat est supprimé. Cela filtre les chaînes mal formées comme https:// sans host, http://example sans domaine de niveau supérieur et les fragments partiels. Le validateur ne vérifie pas si l'URL se résout ou retourne une réponse 200. Il vérifie uniquement la validité syntaxique. Pour vérifier si les URL sont actives, exécutez la liste extraite via le vérificateur de code d'état HTTP un host à la fois. L'étape de validation rejette généralement 5-10 % des correspondances regex brutes comme mal formées. Les références nues www.example.com sont normalisées avec un préfixe https:// avant la validation afin qu'elles passent le parser. La ponctuation finale comme )., , et ] est supprimée avant la validation pour éviter les faux rejets des URL collées à la prose environnante.

Quels protocoles l'extracteur d'URL supporte-t-il ?

L'extracteur correspond à cinq modèles de protocole : http://, https://, ftp://, mailto: et www. nu (qui est normalisé en https://www.). Cela couvre 95 % des URL trouvées dans les entrées du monde réel. L'extracteur ne correspond pas aux schémas tel:, sms:, file://, chrome-extension:// ou autres schémas spécifiques au navigateur par conception. Si vous devez extraire les numéros de téléphone du texte qui mélange URL et liens tel:, utilisez l'extracteur de numéro de téléphone sur la même entrée. Le filtre HTTP/HTTPS uniquement restreint la sortie aux URL web et supprime les correspondances mailto: et ftp://. Le filtre Toutes les URL affiche tout. La portée de 5 protocoles maintient le modèle regex assez rapide pour traiter les entrées multi-mégaoctets en moins d'une seconde sur les navigateurs modernes. Les protocoles personnalisés peuvent être ajoutés en modifiant le modèle regex dans la source si vous forkez l'outil.

Comment dédupliquer les URL ?

La déduplication s'exécute automatiquement après l'extraction. L'outil compare chaque URL par correspondance de chaîne complète incluant le protocole, le host, le path, la query et le fragment. Deux URL qui diffèrent même d'un caractère comptent comme des entrées distinctes. Cela signifie que https://example.com/page et https://example.com/page/ sont deux entrées (différence de slash final). Cela signifie aussi que example.com/page?utm_source=email et example.com/page?utm_source=social sont deux entrées. Si vous voulez des pages uniques indépendamment des paramètres de requête, collez la sortie dans une feuille de calcul, divisez sur ?, et déduplique la colonne path uniquement. Une extraction brute de 12 000 correspondances d'un journal serveur se déduplique généralement en 80-200 URL uniques, une réduction de 60-150x. L'étape de déduplication est ce qui rend l'extracteur utile pour le triage des journaux. Sans déduplication, vous obtenez le compte de correspondance brute, ce qui n'est rarement le nombre que vous voulez.

Comment compter les URL dans du texte ?

Collez le texte, cliquez sur Extraire les URL, et l'outil affiche le compte d'URL unique à côté des totaux du groupe d'hôtes. Pour le compte de correspondance brute avant déduplication, regardez le résumé du résultat qui affiche les deux nombres. Un article de blog de 1 000 mots contient généralement 5-20 URL. Un document juridique de 10 pages contient 30-80 URL. Un fichier journal serveur contient 50-500 URL uniques selon les modèles de trafic. Si vous avez juste besoin du compte sans voir les URL, cet outil donne toujours la réponse la plus rapide. Pour les comptages programmatiques dans les scripts, utilisez grep -oE 'https?://[^ ]+' input.txt | sort -u | wc -l sur la ligne de commande. L'outil de navigateur gagne sur les entrées que vous avez déjà dans votre presse-papiers. L'approche en ligne de commande gagne pour le traitement en batch de 100+ fichiers.

Quelle est la différence entre un extracteur d'URL et un extracteur de lien ?

Un extracteur d'URL lit du texte brut avec regex et en extrait tout ce qui ressemble à une URL. Il fonctionne sur les journaux, JSON, prose, HTML cassé et n'importe quelle entrée non structurée. Un extracteur de lien analyse l'HTML valide avec DOMParser et lit les balises <a href>, retournant des métadonnées structurées comme le texte d'ancrage, les drapeaux nofollow et la classification interne/externe. L'extracteur d'URL est orienté texte. L'extracteur de lien est conscient du HTML. Utilisez l'extracteur d'URL quand votre entrée est désordonnée ou que vous n'avez pas une URL en direct. Utilisez l'extracteur de lien quand vous voulez auditer la structure des liens d'une véritable page web avec le contexte d'ancrage complet. Les deux outils se complètent : extrayez les URL d'un journal, puis exécutez chaque URL unique via l'extracteur de lien pour voir ce que chaque page lie. Ensemble, ils couvrent les entrées de texte non structurées et d'HTML structuré.

L'extracteur d'URL peut-il classifier les liens internes vs externes ?

L'extracteur d'URL ne classe pas les liens par défaut car il n'a aucune notion d'URL de base quand vous collez du texte brut. Le filtre Masquer le même domaine fait le mieux suivant : quand vous récupérez une URL en utilisant le champ ci-dessus, l'outil connaît le host source et peut masquer les URL pointant vers ce même host. Cela vous donne une vue externe uniquement. Pour le texte collé sans une source récupérée, chaque URL compte comme externe car il n'y a pas d'URL de base pour comparer. Si vous avez besoin de la véritable classification interne/externe avec le texte d'ancrage, utilisez l'extracteur de lien. Il récupère l'URL, analyse l'HTML, et étiquette chaque balise <a> comme interne ou externe en fonction du host de la page source. Un article de blog B2B typique a 80 % de liens internes et 20 % de liens externes. Un article de presse inverse ce ratio.

Comment extraire des URL du HTML ?

Collez la source HTML brute dans le champ URL ou coller du texte/HTML et cliquez sur Extraire les URL. La regex capture les URL à l'intérieur des balises <a href>, <img src>, <link href>, <script src>, <iframe src>, les appels CSS en ligne url(), et les URL en texte brut dans le corps HTML. Une page HTML de 50 KB contient généralement 80-200 URL uniques dans toutes ces sources. Utilisez le filtre HTTP/HTTPS uniquement pour vous concentrer sur les URL web et ignorer les correspondances mailto: et ftp://. Pour le HTML où vous voulez spécifiquement seulement les liens d'ancrage et avez besoin du texte d'ancrage, utilisez plutôt l'extracteur de lien. Il analyse le DOM et retourne seulement les correspondances <a href> avec le contenu texte. L'extracteur d'URL est plus large. L'extracteur de lien est plus précis pour les audits spécifiques aux ancres. Choisissez selon que vous voulez chaque URL ou seulement les liens d'ancrage.

Quel modèle regex l'extracteur d'URL utilise-t-il ?

Le modèle correspond aux cinq préfixes de protocole supportés suivis par les caractères URL valides : à peu près (?:https?|ftp|mailto):\/\/[^\s<>"]+ plus une correspondance séparée pour les chaînes www. nues. Le modèle exact gère les cas limites comme les URL se terminant par la ponctuation, les URL avec des parenthèses et les URL contenant des paramètres de requête avec des caractères spéciaux. Après la correspondance, chaque candidat passe par la validation new URL(), donc le regex peut être légèrement permissif sans polluer la sortie. Si vous voulez utiliser le même modèle en dehors du navigateur, la version simplifiée https?:\/\/[^\s<>"]+ fonctionne en Python re.findall et grep -oE. La version complète avec le support mailto et www requiert une échappement plus soignée. Pour la plupart des extractions ad-hoc, le modèle simplifié capture 95 % des URL réelles. L'outil de navigateur utilise la version complète pour l'exhaustivité.

L'extracteur d'URL est-il gratuit ?

Oui. Cet extracteur d'URL est gratuit sans inscription, pas d'upload et pas de limite de débit. Tout s'exécute dans votre navigateur. Vous pouvez coller jusqu'à quelques mégaoctets de texte et extraire les URL en moins d'une seconde. L'outil n'envoie pas votre entrée vers un serveur, ce qui importe lors du traitement de journaux ou d'emails contenant des données sensibles. Comparez avec les outils payants comme Screaming Frog (250 URL gratuites, puis 259 $/an pour illimité) ou Ahrefs (pas d'extraction d'URL gratuite, nécessite un abonnement de 99 $/mois). Ces outils incluent des fonctionnalités que l'extracteur BlazeHive n'a pas, comme le crawling récursif et le scoring SEO. Pour la pure extraction d'URL du texte ou HTML, l'outil de navigateur gratuit couvre le cas d'usage. Associez-le à l'extracteur d'email et l'extracteur de numéro de téléphone pour l'extraction complète de données de contact à partir de la même entrée, tous gratuits.

Pourquoi l'extracteur d'URL supprime-t-il la ponctuation finale ?

Parce que les URL en prose ont souvent la ponctuation collée à la fin. Une phrase comme « Lisez l'article à https://example.com/post. » a la période attachée à l'URL après une correspondance regex naïve. Sans suppression, l'URL extraite devient https://example.com/post. ce qui échoue le parser URL car la période finale n'est pas partie du path. L'extracteur supprime )., ,, ;, ], >, ", ' et . de la fin de chaque correspondance avant la validation. Cela récupère l'URL propre https://example.com/post. La même logique gère les URL en markdown comme [lien](https://example.com) où la parenthèse fermante n'est pas partie de l'URL. Sans suppression de la ponctuation finale, 10-20 % des URL extraites de la prose échoueraient la validation et seraient supprimées. L'étape de suppression est ce qui rend l'extracteur fiable sur du texte du monde réel au lieu de juste des fichiers journaux propres.

Outils gratuits associés

Tous les outils →