O que este extrator de URL extrai do texto bruto
O extrator corresponde aos padrões http, https, ftp, mailto e www. simples dentro de qualquer entrada que você fornecer. Isso cobre 95% dos links do mundo real encontrados em logs de servidor, emails de suporte ao cliente, threads de chat exportadas e artigos colados. Referências simples como www.example.com são normalizadas para https://www.example.com antes da validação para que sobrevivam à etapa de análise. Pontuação final que muitas vezes se cola às URLs em prosa, como )., ,, ; e ], é removida antes do link ser armazenado.
Após a extração, cada candidato passa por new URL(). Qualquer coisa que falhe na análise é descartada. Isso captura strings malformadas como https:// sem host ou http://example sem TLD. A lista limpa é então desduplicada e classificada por host para que você possa ver quais domínios aparecem com mais frequência. Um log de acesso nginx de 4.000 linhas com 12.000 correspondências brutas normalmente se reduz a 80-200 URLs únicas após deduplicação.
Como usar este extrator de URL
- Digite URL ou cole texto/HTML. Solte um log de servidor, carga JSON, exportação de email, parágrafo em prosa ou fonte HTML bruta. Você também pode inserir uma URL no campo acima e clicar em Buscar para carregar o HTML dessa página diretamente.
- Escolha Filtro. Selecione Todas as URLs para ver tudo, Apenas HTTP/HTTPS para pular correspondências mailto e ftp, ou Ocultar mesmo-domínio para suprimir links apontando para o host da página de origem.
- Clique em Extrair URLs. A ferramenta retorna uma lista desduplicada agrupada por host, com uma contagem ao lado de cada domínio e uma opção copiar/baixar para a saída limpa.
Tente isso com um log de webhook Stripe. Cole 200 linhas contendo referências como https://api.stripe.com/v1/charges/ch_3O2, https://yourapp.com/webhooks/stripe e mailto:[email protected]. Defina Filtro como Apenas HTTP/HTTPS. O extrator retorna três URLs únicas agrupadas em dois hosts: api.stripe.com (1 link) e yourapp.com (1 link). A correspondência mailto está oculta. Alterne Filtro de volta para Todas as URLs e o mailto reaparece em seu próprio grupo.
Por que um extrator de URL primeiro em texto supera a análise DOM para entrada confusa
A maioria dos extractores de link requer HTML válido e analisa o DOM para encontrar tags <a href>. Isso funciona para páginas da web limpas, mas quebra em arquivos de log, JSON, texto simples e HTML quebrado onde as âncoras estão faltando ou malformadas. Um extrator de URL baseado em regex lê os bytes brutos e encontra qualquer coisa que se pareça com uma URL, independentemente da estrutura. Isso o torna a ferramenta correta para auditorias de segurança, triagem de tíquetes de suporte, migrações de conteúdo e qualquer cenário onde a entrada não é uma página da web renderizada.
Se você precisar de texto de âncora, sinalizadores nofollow ou classificação interna versus externa de uma página da web real, use o link-extractor em vez disso. Essa ferramenta busca a URL, analisa o DOM com DOMParser e retorna metadados estruturados de âncora. Recorra ao extrator de URL quando a entrada for não estruturada. Recorra ao extrator de link quando a entrada for HTML e você quiser o contexto da âncora.
Erros comuns
- Confundir extrator de URL com extrator de link. O extrator de URL lê qualquer texto e executa regex. O extrator de link analisa HTML e lê tags
<a>. Use o extrator de URL para logs, JSON e prosa. Use link-extractor para analisar a estrutura de link de uma página da web em tempo real. - Esquecer de remover parâmetros de consulta antes de desduplicar para análise. Duas URLs que diferem apenas por
?utm_source=contam como entradas separadas. Se você quiser páginas únicas, execute a saída por uma passagem rápida de planilha para descartar strings de consulta antes de contar. - Colar HTML truncado e perder metade dos links. Copiar e colar do "Exibir Fonte da Página" às vezes trunca em 100KB ou corta no meio de uma tag. Use a opção de busca de URL no campo acima em vez disso, que puxa a resposta completa do servidor.
- Confiar na contagem de deduplicação como contagem de página única. Deduplicação é host mais caminho mais consulta.
example.com/pageeexample.com/page/são duas entradas mesmo que resolvam para a mesma página. Normalize barras à direita se a exclusividade exata for importante. - Executar o extrator em um arquivo de log de 50MB em uma única colagem. Regex do navegador em entradas enormes pode bloquear a guia por 30+ segundos. Divida logs em pedaços de 5MB ou use o modo de busca para URLs individuais.
Dicas avançadas
- Após a extração, canalize a saída para o link-extractor por URL para obter texto de âncora e atributos rel para cada link. As duas ferramentas se encadeiam naturalmente para auditorias de link completas.
- Para migrações de SEO, extraia todas as URLs do seu antigo sitemap.xml, execute a mesma extração no novo sitemap e compare as listas para encontrar páginas ausentes. Um site de 5.000 URLs geralmente tem 50-200 redirecionamentos ausentes após um redesign.
- Use o filtro Ocultar mesmo-domínio ao auditar links de saída de uma única página. Um site de marketing B2B com 80 links internos e 12 links de parceiros externos mostra apenas os 12 externos, tornando a auditoria de parceiros instantânea.
- Emparelhe isso com o email-extractor ao processar despejos de contatos. O extrator de email captura endereços que a regex mailto do extrator de URL perde, como strings
[email protected]brutas sem o prefixomailto:. - Para fluxos de trabalho de desenvolvedor, execute extração em saída git log para encontrar todas as referências externas em mensagens de commit. Um histórico de 2.000 commits geralmente contém 40-80 URLs de referência únicas (tíquetes Jira, PRs GitHub, threads Slack).
Assim que você tiver uma lista limpa de URL, o próximo passo depende do seu objetivo. Para auditoria de link HTML com contexto de âncora, execute cada URL através do link-extractor. Para encontrar informações de contato na mesma entrada, use o email-extractor e phone-number-extractor na mesma colagem. Para crawls baseados em sitemap, o sitemap-checker oferece a visualização XML estruturada que a abordagem regex ignora.