O que este extrator de links retorna
A saída é uma linha por <a href> na página. Cada linha traz a URL de destino, o texto âncora visível, o atributo rel (com nofollow, sponsored, ugc, e noopener identificados), o valor de destino, e uma coluna de tipo: interna, externa, âncora, mailto, ou tel. Um blog típico com 300 links na página inicial se divide em 70% interna, 25% externa, 5% âncora ou mailto. O menu suspenso de filtro reduz a visão para um segmento. Essa estrutura é o que a torna diferente de um extrator de URL baseado em regex sobre texto. Você obtém o contexto completo do DOM para cada link, não apenas a string de URL.
Como usar este extrator de links
- Digite a URL da Página. Cole a URL completa incluindo
https://. A ferramenta busca a página no servidor, então a URL deve ser acessível publicamente. Páginas atrás de login ou bloqueios rigorosos de bots retornam um erro de busca. - Selecione Mostrar. Escolha um de cinco filtros: Todos os links, Apenas internos, Apenas externos, Apenas nofollow, ou Apenas texto âncora vazio. O padrão é Todos. Mude para Apenas internos para auditorias de estrutura de site, Apenas externos para revisões de links de saída, Apenas nofollow ao verificar marcação de conteúdo patrocinado.
- Clique em Extrair links. A ferramenta retorna uma tabela em 2-4 segundos. Copie para a área de transferência ou baixe como CSV.
Experimente com uma página inicial de blog. Digite uma URL, deixe Mostrar em Todos os links. Você vê 124 linhas: 87 internas, 31 externas, 6 saltos de âncora. Mude para Apenas texto âncora vazio e 4 linhas aparecem, todos envoltórios de logo e links de ícone. Esses são os que você corrige primeiro porque crawlers e leitores de tela ambos identificam âncoras vazias. Use o url-extractor quando você só precisa de URLs brutas de texto ou markdown sem contexto HTML.
Por que texto âncora e atributos rel importam para SEO
O texto âncora diz aos mecanismos de busca sobre o que trata a página vinculada. Um link ancorado "ferramenta gratuita de auditoria de SEO" passa mais relevância temática do que um ancorado "clique aqui". Páginas com 80% de âncoras genéricas ("leia mais", "aqui", "isto") classificam 5-8 posições mais baixas em média do que páginas com âncoras internas descritivas, de acordo com estudos do Ahrefs de 1.2 milhão de SERPs.
Atributos rel alteram como o equity de link flui. rel="nofollow" diz ao Google para ignorar o link para classificação. rel="sponsored" marca placements pagos. rel="ugc" marca links de comentários gerados por usuários. Usar incorretamente (nofollowing links internos, esquecendo de marcar conteúdo patrocinado) tanto vaza orçamento quanto arrisca uma ação manual. Este extrator expõe cada valor de rel para que você possa identificar um nofollow em um link de navegação em segundos. Combine com o canonical-checker para verificar se as páginas vinculadas enviam o sinal canônico correto.
Erros comuns
- Tratá-lo como um raspador JavaScript. A ferramenta busca HTML bruto. Se uma página renderiza links via React ou Vue do lado do cliente, esses links não aparecerão a menos que existam na resposta inicial do servidor. Use o google-crawler-simulator para páginas renderizadas com JS.
- Ignorar linhas de âncora vazia. Uma âncora vazia geralmente significa um link apenas com ícone sem aria-label ou fallback alt. Crawlers não veem contexto, leitores de tela não anunciam nada.
- Confundir nofollow com noindex. Nofollow controla fluxo de equity de link em um único link. Noindex controla se a página de destino se classifica.
- Auditar apenas uma página. Uma página inicial mostra 100 links, mas o gráfico real de links emerge em 50-100 páginas. Execute o extrator em templates principais (página inicial, hub de blog, categoria, produto).
- Pular o filtro Externo + Nofollow em posts de convidado. Se você aceita conteúdo patrocinado, a combinação verifica se sua marcação patrocinada é consistente.
Dicas avançadas
- Para auditorias de link interno, execute o extrator em suas 20 principais páginas de destino orgânico e verifique se cada uma tem 3-8 links internos contextuais para páginas de receita. Páginas com menos de 3 links internos são rastreadas com menos frequência e perdem 15-25% do equity de link potencial.
- Faça referência cruzada com o url-extractor quando você tiver uma exportação markdown. A versão HTML expõe nofollow e rel; a versão regex captura links dentro de blocos de código que a versão HTML pula.
- Use Apenas texto âncora vazio como uma auditoria rápida de acessibilidade. WCAG 2.2 falha em qualquer link sem um nome acessível. Uma taxa de âncora vazia de 5%+ sinaliza um defeito.
- Depois de extrair links externos, cole-os em um verificador de status em massa para capturar 404s. Objetivo: menos de 1% de links externos quebrados nas páginas principais.
- Compare taxas entre concorrentes. Páginas classificadas na primeira página para palavras-chave comerciais têm em média 12-18% links externos e 82-88% internos. Mais de 30% externo geralmente vaza autoridade.
Depois de ter uma auditoria de link limpa, verifique se as páginas vinculadas enviam sinais consistentes. Execute cada destino único através do canonical-checker para confirmar autocanonicização, e do google-crawler-simulator para ver como o Googlebot as renderiza. Para inventário de URL em massa extraído de dumps de texto, o url-extractor manipula entrada de colagem que o extrator de links não aceita.