Ce que cet extracteur de liens retourne
La sortie affiche une ligne par <a href> sur la page. Chaque ligne contient l'URL de destination, le texte d'ancrage visible, l'attribut rel (avec nofollow, sponsored, ugc et noopener signalés), la valeur de la cible, et une colonne de type : interne, externe, ancrage, mailto, ou tel. Une homepage de blog typique avec 300 liens se décompose en 70 % internes, 25 % externes, 5 % ancrage ou mailto. Le menu déroulant de filtre réduit la vue à une seule catégorie. Cette structure est ce qui la différencie d'un extracteur d'URL basé sur regex. Vous obtenez le contexte DOM complet pour chaque lien, pas seulement la chaîne d'URL.
Comment utiliser cet extracteur de liens
- Entrez l'URL de la page. Collez l'URL complète incluant
https://. L'outil récupère la page côté serveur, donc l'URL doit être publiquement accessible. Les pages protégées par une connexion ou des blocages de bot stricts retournent une erreur de récupération. - Sélectionnez Afficher. Choisissez l'un des cinq filtres : Tous les liens, Interne uniquement, Externe uniquement, Nofollow uniquement, ou Texte d'ancrage vide uniquement. Par défaut : Tous. Passez à Interne uniquement pour les audits de structure de site, Externe uniquement pour les examens de liens sortants, Nofollow uniquement lors de la vérification du balisage sponsorisé.
- Cliquez sur Extraire les liens. L'outil retourne un tableau en 2 à 4 secondes. Copiez dans le presse-papiers ou téléchargez en CSV.
Essayez ceci avec une homepage de blog. Entrez une URL, laissez Afficher sur Tous les liens. Vous voyez 124 lignes : 87 internes, 31 externes, 6 sauts d'ancrage. Passez à Texte d'ancrage vide uniquement et 4 lignes apparaissent, tous des wrappers de logo et des liens d'icônes. Ce sont ceux-ci que vous corrigez en premier car les crawlers et les lecteurs d'écran signalent tous deux les ancres vides. Utilisez l'url-extractor lorsque vous avez seulement besoin d'URL brutes à partir de texte ou de markdown sans contexte HTML.
Pourquoi le texte d'ancrage et les attributs rel importent pour le SEO
Le texte d'ancrage indique aux moteurs de recherche de quoi parle la page liée. Un lien ancré « outil d'audit SEO gratuit » transmet plus de pertinence thématique qu'un lien ancré « cliquez ici ». Les pages avec 80 % d'ancres génériques (« lire la suite », « ici », « ceci ») se classent en moyenne 5 à 8 positions plus bas que les pages avec des ancres internes descriptives, selon les études Ahrefs de 1,2 million de SERPs.
Les attributs rel modifient le flux de l'équité des liens. rel="nofollow" indique à Google d'ignorer le lien pour le classement. rel="sponsored" signale les placements payants. rel="ugc" signale les liens des commentaires générés par les utilisateurs. L'abus de ceux-ci (nofollower les liens internes, oublier de marquer le contenu sponsorisé) soit fuit le budget soit risque une action manuelle. Cet extracteur expose chaque valeur rel afin que vous puissiez repérer un nofollow sur un lien de navigation en quelques secondes. Associez-le au canonical-checker pour vérifier que les pages liées envoient le bon signal canonique.
Erreurs courantes
- Le traiter comme un scraper JavaScript. L'outil récupère du HTML brut. Si une page affiche les liens via React ou Vue côté client, ces liens n'apparaîtront que s'ils existent dans la réponse initiale du serveur. Utilisez le google-crawler-simulator pour les pages rendues en JS.
- Ignorer les lignes d'ancre vide. Une ancre vide signifie généralement un lien basé sur une icône sans aria-label ou fallback alt. Les crawlers ne voient pas de contexte, les lecteurs d'écran n'annoncent rien.
- Confondre nofollow et noindex. Nofollow contrôle le flux d'équité des liens sur un seul lien. Noindex contrôle si la page de destination elle-même se classe.
- Auditer une seule page. Une homepage affiche 100 liens, mais le graphique réel des liens émerge sur 50 à 100 pages. Exécutez l'extracteur sur les top templates (homepage, hub de blog, catégorie, produit).
- Sauter le filtre Externe + Nofollow sur les articles invités. Si vous acceptez du contenu sponsorisé, la combinaison vérifie que votre balisage sponsorisé est cohérent.
Conseils avancés
- Pour les audits de liens internes, exécutez l'extracteur sur vos 20 meilleures pages de destinations organiques et vérifiez que chacune possède 3 à 8 liens internes contextuels vers les pages de revenus. Les pages avec moins de 3 liens internes sont crawlées moins souvent et perdent 15 à 25 % de l'équité potentielle des liens.
- Recoupez la sortie avec l'url-extractor lorsque vous avez une exportation markdown. La version HTML expose nofollow et rel ; la version regex capture les liens dans les blocs de code que la version HTML ignore.
- Utilisez Texte d'ancrage vide uniquement comme audit d'accessibilité rapide. WCAG 2.2 échoue tout lien sans un nom accessible. Un taux d'ancre vide de 5 % + signale un défaut.
- Après extraction des liens externes, collez-les dans un vérificateur de statut en masse pour capturer les 404. Visez moins de 1 % de liens externes brisés sur les pages principales.
- Comparez les ratios sur les concurrents. Les pages classées en première page pour les mots-clés commerciaux affichent en moyenne 12 à 18 % de liens externes et 82 à 88 % de liens internes. Plus de 30 % d'externes fuit généralement l'autorité.
Une fois que vous avez un audit de lien propre, vérifiez que les pages liées envoient des signaux cohérents. Exécutez chaque destination unique via le canonical-checker pour confirmer l'auto-canonicalisation, et le google-crawler-simulator pour voir comment Googlebot les affiche. Pour l'inventaire d'URL en masse extrait de dumps de texte, l'url-extractor traite l'entrée collée que l'extracteur de liens n'accepte pas.
Foire Aux Questions
Qu'est-ce qu'un extracteur de liens ?
Un extracteur de liens récupère le HTML d'une page web et retourne une liste structurée de chaque élément <a href> sur celle-ci. La sortie inclut l'URL de destination, le texte d'ancrage, l'attribut rel, la cible, et si le lien est interne ou externe. Les SEOs l'utilisent pour auditer la structure des liens internes, trouver les balises nofollow manquantes sur le contenu sponsorisé, et vérifier que le texte d'ancrage est descriptif plutôt que générique. Une page de contenu typique expose 30 à 150 liens. Sans outil, les auditer à la main signifie cliquer droit sur chacun. Avec cet extracteur, vous collez une URL et obtenez un tableau triable en quelques secondes. Filtrez le résultat par Interne, Externe, Nofollow, ou Ancre vide pour vous concentrer sur une tranche. Utilisez l'url-extractor lorsque vous avez seulement besoin d'URL sans le contexte d'attribut HTML.
Comment extraire tous les liens d'un site web ?
Pour extraire chaque lien d'une seule page, collez l'URL et cliquez sur Extraire les liens. Le résultat affiche chaque <a href> avec le texte d'ancrage, rel, et la classification interne vs externe, prêt à copier ou télécharger en CSV. Pour extraire les liens d'un site web entier, vous exécutez l'outil sur chaque page individuellement, utilisez un crawler comme Screaming Frog, ou tirez d'abord les URLs du sitemap XML du site et traitez chacune. Pour un site de 500 pages, l'extraction de sitemap plus les audits de lien par page sur les 20 meilleurs templates surface 95 % des problèmes structurels de lien. Commencez par la homepage, le hub de blog, et les pages de destination avec le plus de trafic. L'url-extractor accepte le collage de texte en masse si vous avez déjà une liste de pages à traiter. Pour les audits automatisés, planifiez les mêmes 20 templates mensuellement et comparez les comptages de liens pour détecter les changements silencieux de navigation.
Quelle est la différence entre un extracteur de liens et un extracteur d'URL ?
Un extracteur de liens analyse le HTML et parcourt les éléments <a href>, retournant le texte d'ancrage, les attributs rel, la cible, et le type de lien (interne, externe, ancrage, mailto). Un extracteur d'URL exécute une regex sur du texte ou du markdown et tire chaque chaîne d'URL qu'il trouve, peu importe que cette URL soit un lien cliquable, une référence de code, ou un commentaire. L'extracteur de liens est construit pour les audits SEO où rel et ancre comptent. L'extracteur d'URL est construit pour l'inventaire d'URL en masse, comme nettoyer une exportation markdown ou tirer les liens d'une archive Slack. Utilisez cet outil lorsque vous avez besoin du contexte au niveau du DOM pour un audit. Utilisez l'url-extractor lorsque vous avez un bloc de texte et avez juste besoin d'une liste d'URL dédupliquée. Les deux peuvent fonctionner sur la même source : extrayez les liens ici, puis collez les destinations dans l'extracteur d'URL pour un dédoublonnage et une normalisation supplémentaires sur plusieurs pages.
Comment le texte d'ancrage affecte-t-il les classements SEO ?
Le texte d'ancrage indique aux moteurs de recherche de quoi parle la page liée. Les ancres descriptives (« calculateur CTR gratuit ») transmettent la pertinence thématique. Les ancres génériques (« cliquez ici », « lire la suite ») n'en transmettent presque pas. Les systèmes d'évaluation des liens de Google pondèrent les ancres descriptives 3 à 5 fois plus lourdement que les ancres génériques pour les signaux de lien interne. Les pages avec 70 % + d'ancres internes descriptives se classent en moyenne 6 positions plus haut que les pages avec la plupart des ancres génériques, selon une analyse Ahrefs 2024 de 1,2 million de SERPs. La correction : auditez vos 20 meilleures pages de destinations internes, listez les ancres entrantes, et réécrivez les génériques pour inclure le mot-clé primaire de la page cible sous forme naturelle. Évitez le bourrage de correspondance exacte sur chaque lien. Visez la variation : mot-clé, correspondance partielle, marque, phrase descriptive. Une distribution propre bat une ancre optimisée unique répétée 50 fois sur le site.
Que fait rel="nofollow" sur un lien ?
L'attribut rel="nofollow" indique aux moteurs de recherche de ne pas transmettre les signaux de classement via ce lien. Google l'a introduit en 2005 pour combattre le spam de commentaires. Aujourd'hui, Google traite nofollow comme un indice plutôt qu'une directive stricte, mais la plupart des autres moteurs de recherche le respectent encore comme une règle dure. Utilisez nofollow sur le contenu généré par les utilisateurs (messages de forum, commentaires de blog), les liens externes non fiables, et les pages de connexion ou d'administration. Ne l'utilisez pas sur la navigation interne, les liens de footer, ou vos propres liens sortants contextuels vers des sources autoritaires. Une page typique de 100 liens devrait avoir moins de 5 % de liens internes nofollow. Le filtre Nofollow uniquement de cet extracteur expose chaque lien nofollow en quelques secondes afin que vous puissiez repérer les abus sans scanner le tableau complet. Pour les liens sponsorisés ou payants, utilisez rel="sponsored". Pour les commentaires des utilisateurs, utilisez rel="ugc". Mélanger les trois correctement vous garde en conformité avec la politique des attributs de lien de Google 2019.
Un extracteur de liens peut-il extraire des liens à partir de pages rendues en JavaScript ?
Cet outil récupère du HTML brut, ce qui signifie qu'il voit seulement les liens présents dans la réponse initiale du serveur. Les pages rendues en JavaScript (React, Vue, Angular SPAs sans rendu côté serveur) injectent souvent les liens dans le DOM après le chargement de la page. Ces liens n'apparaîtront que si le framework les pré-affiche aussi côté serveur. Pour auditer les structures de liens rendues en JS, vous avez besoin d'un outil qui exécute un navigateur sans tête et attend l'hydratation de la page. Le google-crawler-simulator affiche les pages comme le fait Googlebot, incluant l'exécution JavaScript, et expose l'inventaire de lien après rendu. Environ 35 % des sites modernes mélangent les liens rendus côté serveur et côté client, donc un extracteur HTML uniquement peut manquer 10 à 40 % des liens sur ces pages. Si votre CMS est WordPress, Strapi, Astro, ou Next.js avec SSR, l'extracteur de liens capture tout.
Comment extraire le texte d'ancrage d'un site web ?
Collez l'URL de la page dans l'extracteur de liens et cliquez sur Extraire les liens. La colonne Ancre affiche le texte visible à l'intérieur de chaque balise <a>, y compris le texte à l'intérieur des éléments <span> ou <strong> imbriqués. Pour les liens d'image (une <img> enveloppée dans une <a>), l'extracteur retourne le texte alt de l'image comme ancre quand présent, ou signale la ligne comme Texte d'ancrage vide quand alt est manquant. Pour auditer les modèles de texte d'ancrage à grande échelle, exportez le résultat en CSV et exécutez un compte de fréquence dans Excel ou Google Sheets. Une distribution d'ancre saine affiche la variation : 40 à 60 % descriptive, 15 à 25 % marque, 10 à 20 % correspondance partielle de mot-clé, moins de 10 % générique. N'importe quel taux au-dessus de 30 % d'ancre générique signale une lacune dans les liens internes. Répétez l'audit sur vos 10 pages principales de trafic chaque trimestre pour détecter la dérive au fur et à mesure que du nouveau contenu ajoute des liens.
Qu'est-ce qu'un vérificateur de liens internes ?
Un vérificateur de liens internes audite les liens pointant d'une page vers d'autres pages du même domaine. Il expose les pages orphelines, les liens internes brisés, les liens contextuels manquants, et le texte d'ancrage sur-optimisé. Cet extracteur de liens fonctionne aussi comme un vérificateur de liens internes lorsque vous passez le filtre Afficher à Interne uniquement. Chaque ligne affiche l'URL de destination, l'ancre, et rel. Pour trouver les pages orphelines (pages sans liens internes entrants), recoupez la sortie de l'extracteur sur vos 20 meilleurs templates contre votre sitemap. Les pages du sitemap mais pas dans la carte des liens entrants sont des orphelines. Un site typique a un taux d'orphelin de 5 à 15 % après un an de croissance de contenu organique. Exécutez l'extracteur sur votre homepage, hub de blog, et pages de catégories principales mensuellement pour détecter les orphelines avant qu'elles ne perdent leurs classements.
Comment trouver les liens externes sur une page ?
Collez l'URL de la page et passez le filtre Afficher à Externe uniquement. La sortie se réduit à chaque lien pointant hors du domaine. La colonne Type confirme chaque ligne comme externe. La colonne Rel affiche si le lien porte les balises nofollow, sponsored, ou ugc. La colonne Target affiche si le lien s'ouvre dans un nouvel onglet. Un article de contenu typique porte 3 à 8 liens externes. Moins de 3 semble mal cité (les systèmes de contenu utile de Google pondèrent les citations externes comme un signal de qualité). Plus de 15 commence à ressembler à une ferme de liens sauf si vous êtes une page de ressource sélectionnée. Après extraction des liens externes, collez-les dans un vérificateur de statut en masse pour détecter les 404. Les 404 sortants sur les pages principales érodent la confiance de l'utilisateur et gaspillent le budget de crawl. Visez moins de 1 % de liens externes brisés sur vos pages principales de trafic.
Pourquoi mon extracteur de liens retourne-t-il moins de liens que je n'en vois sur la page ?
Trois causes courantes. D'abord, le rendu JavaScript : si la page injecte les liens côté client, la récupération HTML uniquement les manque. Passez au google-crawler-simulator pour un rendu complet. Deuxièmement, l'outil exclut les éléments non-<a href>. Les boutons stylisés comme des liens et les gestionnaires JavaScript ne comptent pas comme des liens raçonnables et n'apparaîtront pas. Les moteurs de recherche les ignorent aussi, donc l'écart est correct du point de vue SEO. Troisièmement, les sauts d'ancrage et les liens mailto/tel sont catégorisés comme leurs propres types. Si votre filtre est défini sur Interne uniquement, les liens mailto n'apparaîtront pas. Passez à Tous les liens pour voir l'inventaire complet. Environ 95 % des rapports « lien manquant » remontent à l'une de ces trois causes.
Quel est un bon ratio de liens internes par rapport aux externes ?
Pour les pages de contenu axées sur le SEO, visez 80 à 90 % de liens internes et 10 à 20 % de liens externes. Les pages classées en première page pour les mots-clés commerciaux affichent en moyenne 12 à 18 % de liens externes et 82 à 88 % de liens internes, selon les analyses de 50 000 SERPs par Ahrefs en 2024. Trop peu de citations externes (moins de 5 %) signalent un contenu mince ou autoréférentiel. Trop beaucoup (plus de 30 %) fuient l'autorité et ressemblent à du spam. Le mélange compte. Les liens externes doivent pointer vers des sources autoritaires (études évaluées par des pairs, données gouvernementales, publications de premier plan). Les liens internes doivent connecter les pages contextuellement liées, pas seulement les éléments de nav. Exécutez cet extracteur sur vos 10 meilleures pages de destinations organiques et calculez le ratio. Si vous êtes en dehors de la bande 80/20, réécrivez d'abord le mélange de lien sur les pages sous-performantes.
Cet extracteur de liens est-il gratuit ?
Oui. L'extracteur de liens est gratuit sans inscription, sans limites de taux qui valent la peine de s'inquiéter pour un usage d'audit normal, et sans plafond d'utilisation. Collez une URL, obtenez un tableau structuré de chaque lien, copiez ou téléchargez en CSV. L'outil récupère le HTML côté serveur et exécute la logique d'analyse sur notre infrastructure, vous n'avez donc pas besoin d'installer des extensions de navigateur ou d'exécuter localement des scripts de scraping. Il fonctionne sur n'importe quelle page publiquement accessible. Les pages protégées par authentification, paywalls, ou protection bot agressive retournent une erreur de récupération. La plupart des pages retournent des résultats en 2 à 4 secondes, indépendamment du nombre de liens. La sortie inclut le texte d'ancrage, les attributs rel, la cible, la classification interne vs externe, et le type de lien. Pour le travail d'inventaire d'URL en masse où vous avez une liste d'URL à déduplier, utilisez l'url-extractor à la place.
Comment vérifier les balises nofollow brisées ?
Collez l'URL et passez le filtre Afficher à Nofollow uniquement. Le résultat affiche chaque lien avec rel="nofollow", rel="sponsored", ou rel="ugc". Scannez la liste pour deux modes de défaillance. D'abord, les liens de navigation internes ou de footer portant nofollow : ceux-ci ne devraient presque jamais être nofollowed car ils gaspillent l'équité des liens internes sur les pages que vous contrôlez. Corrigez en supprimant l'attribut rel. Deuxièmement, les liens sponsorisés ou d'affiliation manquant la balise sponsored ou ugc : ceux-ci devraient porter la bonne valeur rel pour se conformer à la politique de spam de lien de Google. Environ 20 à 30 % des sites que nous testons ont au moins un nofollow mal utilisé. Les détecter tôt prévient les actions manuelles accidentelles. Exécutez cet audit sur chaque page qui porte des placements payants, des liens d'affiliation, ou des commentaires générés par les utilisateurs.
Qu'affiche le filtre Texte d'ancrage vide uniquement ?
Le filtre Texte d'ancrage vide uniquement expose chaque lien sur la page où le texte visible est manquant ou contient seulement de l'espace blanc. Les cas les plus courants sont les wrappers de logo (une <a> autour d'une <img> sans texte alt), les boutons basés sur les icônes uniquement (icônes de partage social, icônes de recherche), et les liens décoratifs enveloppant des images de fond. Les ancres vides nuisent au SEO car les crawlers ne peuvent pas déduire le contexte du lien, et ils échouent aux audits d'accessibilité car les lecteurs d'écran n'annoncent rien. WCAG 2.2 Critère de succès 2.4.4 exige que chaque lien ait un nom accessible. La correction est soit d'ajouter du texte alt à l'image enveloppée, d'ajouter aria-label au lien, ou de remplacer le lien basé sur l'icône uniquement par un composant étiqueté. Une page propre devrait avoir zéro lignes d'ancre vide. Un taux d'ancre vide de 5 % + signale qu'un audit d'accessibilité est en retard.
Quel est le meilleur extracteur de liens pour les audits SEO ?
Le meilleur extracteur de liens pour les audits SEO retourne une sortie consciente du DOM : texte d'ancrage, attributs rel, cible, et classification interne vs externe par ligne. Les extracteurs basés sur regex manquent ce contexte. Les extensions de navigateur fonctionnent pour les vérifications ponctuelles mais ne s'adaptent pas aux audits multi-pages. Les analyseurs HTML côté serveur (comme cet outil) trouvent l'équilibre idéal pour les audits rapides par page. Pour les crawls complets de 1 000 + pages, les crawlers dédiés comme Screaming Frog ou Sitebulb ont du sens. Pour les audits par page lors de la production de contenu ou de l'assurance qualité de template, cet outil retourne des résultats en 2 à 4 secondes sans configuration. Le filtre Afficher vous laisse réduire à Interne, Externe, Nofollow, ou Ancre vide en un clic, ce qui rend les audits spécifiques plus rapides que la manipulation de feuille de calcul. Associez-le au canonical-checker lorsque vous devez aussi vérifier les signaux canoniques de destination.