Ce que cet extracteur d'URL extrait du texte brut
L'extracteur correspond aux modèles http, https, ftp, mailto, et www. nu à l'intérieur de n'importe quelle entrée que vous lui fournissez. Cela couvre 95 % des liens du monde réel trouvés dans les journaux serveur, les e-mails d'assistance client, les threads de chat exportés et les articles collés. Les références nues www.example.com sont normalisées en https://www.example.com avant la validation afin qu'elles survivent à l'étape d'analyse. La ponctuation finale qui s'attache souvent aux URL en prose, comme )., ,, ; et ], est supprimée avant que le lien soit stocké.
Après l'extraction, chaque candidat passe par new URL(). Tout ce qui échoue au parsing est supprimé. Cela capture les chaînes mal formées comme https:// sans host ou http://example sans TLD. La liste propre est ensuite dédupliquée et triée par host afin que vous puissiez voir quels domaines apparaissent le plus souvent. Un journal d'accès nginx de 4 000 lignes avec 12 000 correspondances brutes se réduit généralement à 80-200 URL uniques après la déduplication.
Comment utiliser cet extracteur d'URL
- Entrez une URL ou collez du texte/HTML. Déposez un journal serveur, une charge JSON, un export d'email, un paragraphe en prose ou une source HTML brute. Vous pouvez aussi entrer une URL dans le champ ci-dessus et cliquer sur Fetch pour charger directement le HTML de cette page.
- Choisissez Filtre. Sélectionnez Toutes les URL pour voir tout, HTTP/HTTPS uniquement pour ignorer les correspondances mailto et ftp, ou Masquer le même domaine pour supprimer les liens pointant vers le host de la page source.
- Cliquez sur Extraire les URL. L'outil retourne une liste dédupliquée regroupée par host, avec un compte à côté de chaque domaine et une option de copie/téléchargement pour la sortie propre.
Essayez ceci avec un journal webhook Stripe. Collez 200 lignes contenant des références comme https://api.stripe.com/v1/charges/ch_3O2, https://yourapp.com/webhooks/stripe et mailto:[email protected]. Définissez Filtre sur HTTP/HTTPS uniquement. L'extracteur retourne trois URL uniques regroupées sous deux hosts : api.stripe.com (1 lien) et yourapp.com (1 lien). La correspondance mailto est masquée. Basculez Filtre sur Toutes les URL et la correspondance mailto réapparaît dans son propre groupe.
Pourquoi un extracteur d'URL basé sur le texte surpasse le parsing DOM pour les entrées désordonnées
La plupart des extracteurs de lien nécessitent un HTML valide et analysent le DOM pour trouver les balises <a href>. Cela fonctionne pour les pages web propres mais échoue sur les fichiers journaux, JSON, texte brut et HTML cassé où les ancres sont manquantes ou mal formées. Un extracteur d'URL basé sur regex lit les bytes bruts et trouve tout ce qui ressemble à une URL, indépendamment de la structure. Cela le rend adapté aux audits de sécurité, au triage des tickets d'assistance, aux migrations de contenu et à tout scénario où l'entrée n'est pas une page web rendue.
Si vous avez besoin du texte d'ancrage, des drapeaux nofollow ou de la classification interne/externe d'une véritable page web, utilisez plutôt l'extracteur de lien. Cet outil récupère l'URL, analyse le DOM avec DOMParser, et retourne des métadonnées d'ancrage structurées. Utilisez l'extracteur d'URL quand l'entrée est non structurée. Utilisez l'extracteur de lien quand l'entrée est HTML et que vous voulez le contexte de l'ancrage.
Erreurs courantes
- Confondre extracteur d'URL avec extracteur de lien. L'extracteur d'URL lit n'importe quel texte et exécute une regex. L'extracteur de lien analyse l'HTML et lit les balises
<a>. Utilisez l'extracteur d'URL pour les journaux, JSON et prose. Utilisez l'extracteur de lien pour analyser la structure des liens d'une page web en direct. - Oublier de supprimer les paramètres de requête avant la déduplication pour l'analytique. Deux URL qui diffèrent uniquement par
?utm_source=comptent comme des entrées distinctes. Si vous voulez des pages uniques, exécutez la sortie via une passage rapide en feuille de calcul pour supprimer les chaînes de requête avant le comptage. - Coller du HTML tronqué et en manquer la moitié des liens. Copier-coller depuis « View Page Source » tronque parfois à 100 KB ou coupe au milieu d'une balise. Utilisez plutôt l'option de récupération d'URL dans le champ ci-dessus, qui récupère la réponse serveur complète.
- Faire confiance au compte de déduplication comme count de page unique. La déduplication est host plus path plus query.
example.com/pageetexample.com/page/sont deux entrées même si elles résolvent vers la même page. Normalisez les slashes finaux si l'unicité exacte importe. - Exécuter l'extracteur sur un fichier journal de 50 Mo en une seule pâte. La regex du navigateur sur des entrées énormes peut bloquer l'onglet pendant 30+ secondes. Divisez les journaux en chunks de 5 MB ou utilisez le mode fetch pour les URL individuelles.
Conseils avancés
- Après l'extraction, canalisez la sortie dans l'extracteur de lien par URL pour obtenir le texte d'ancrage et les attributs rel pour chaque lien. Les deux outils s'enchaînent naturellement pour des audits de lien complets.
- Pour les migrations SEO, extrayez chaque URL de votre ancien sitemap.xml, exécutez la même extraction sur le nouveau sitemap, et comparez les listes pour trouver les pages manquantes. Un site de 5 000 URL a généralement 50-200 redirections manquantes après une refonte.
- Utilisez le filtre Masquer le même domaine lors de l'audit des liens sortants d'une seule page. Un site marketing B2B avec 80 liens internes et 12 liens externes partenaires montre seulement les 12 externes, rendant l'audit partenaire instantané.
- Associez ceci à l'extracteur d'email lors du traitement de dumps de contacts. L'extracteur d'email capture les adresses que la regex mailto de l'extracteur d'URL manque, comme les chaînes nues
[email protected]sans le préfixemailto:. - Pour les workflows de développeur, exécutez l'extraction sur la sortie git log pour trouver chaque référence externe dans les messages de commit. Un historique de 2 000 commits contient généralement 40-80 URL de référence unique (tickets Jira, PR GitHub, threads Slack).
Une fois que vous avez une liste d'URL propre, l'étape suivante dépend de votre objectif. Pour l'audit de lien HTML avec contexte d'ancrage, exécutez chaque URL via l'extracteur de lien. Pour trouver les infos de contact dans la même entrée, utilisez l'extracteur d'email et l'extracteur de numéro de téléphone sur la même pâte. Pour les crawls basés sur sitemap, le vérificateur de sitemap vous donne la vue XML structurée que l'approche regex omet.