Ir para o conteúdo
Verificação ao vivo · busca sua URL no servidor

URL Extractor

Extraia todas as URLs de qualquer texto, arquivo de log, email ou página com um clique.

Um URL Extractor examina qualquer bloco de texto, arquivo de log, despejo JSON, corpo de email ou HTML bruto e extrai todos os links que encontra. Esta ferramenta executa uma regex sobre o que você cola, valida cada correspondência com o analisador URL do navegador, remove pontuação final como vírgulas e pontos, remove duplicatas dos resultados e os agrupa por host. Filtre a saída para todas as URLs, apenas HTTP/HTTPS ou oculte links do mesmo domínio. Sem cadastro, sem upload, tudo fica no seu navegador.

or

O que este extrator de URL extrai do texto bruto

O extrator corresponde aos padrões http, https, ftp, mailto e www. simples dentro de qualquer entrada que você fornecer. Isso cobre 95% dos links do mundo real encontrados em logs de servidor, emails de suporte ao cliente, threads de chat exportadas e artigos colados. Referências simples como www.example.com são normalizadas para https://www.example.com antes da validação para que sobrevivam à etapa de análise. Pontuação final que muitas vezes se cola às URLs em prosa, como )., ,, ; e ], é removida antes do link ser armazenado.

Após a extração, cada candidato passa por new URL(). Qualquer coisa que falhe na análise é descartada. Isso captura strings malformadas como https:// sem host ou http://example sem TLD. A lista limpa é então desduplicada e classificada por host para que você possa ver quais domínios aparecem com mais frequência. Um log de acesso nginx de 4.000 linhas com 12.000 correspondências brutas normalmente se reduz a 80-200 URLs únicas após deduplicação.

Como usar este extrator de URL

  1. Digite URL ou cole texto/HTML. Solte um log de servidor, carga JSON, exportação de email, parágrafo em prosa ou fonte HTML bruta. Você também pode inserir uma URL no campo acima e clicar em Buscar para carregar o HTML dessa página diretamente.
  2. Escolha Filtro. Selecione Todas as URLs para ver tudo, Apenas HTTP/HTTPS para pular correspondências mailto e ftp, ou Ocultar mesmo-domínio para suprimir links apontando para o host da página de origem.
  3. Clique em Extrair URLs. A ferramenta retorna uma lista desduplicada agrupada por host, com uma contagem ao lado de cada domínio e uma opção copiar/baixar para a saída limpa.

Tente isso com um log de webhook Stripe. Cole 200 linhas contendo referências como https://api.stripe.com/v1/charges/ch_3O2, https://yourapp.com/webhooks/stripe e mailto:[email protected]. Defina Filtro como Apenas HTTP/HTTPS. O extrator retorna três URLs únicas agrupadas em dois hosts: api.stripe.com (1 link) e yourapp.com (1 link). A correspondência mailto está oculta. Alterne Filtro de volta para Todas as URLs e o mailto reaparece em seu próprio grupo.

Por que um extrator de URL primeiro em texto supera a análise DOM para entrada confusa

A maioria dos extractores de link requer HTML válido e analisa o DOM para encontrar tags <a href>. Isso funciona para páginas da web limpas, mas quebra em arquivos de log, JSON, texto simples e HTML quebrado onde as âncoras estão faltando ou malformadas. Um extrator de URL baseado em regex lê os bytes brutos e encontra qualquer coisa que se pareça com uma URL, independentemente da estrutura. Isso o torna a ferramenta correta para auditorias de segurança, triagem de tíquetes de suporte, migrações de conteúdo e qualquer cenário onde a entrada não é uma página da web renderizada.

Se você precisar de texto de âncora, sinalizadores nofollow ou classificação interna versus externa de uma página da web real, use o link-extractor em vez disso. Essa ferramenta busca a URL, analisa o DOM com DOMParser e retorna metadados estruturados de âncora. Recorra ao extrator de URL quando a entrada for não estruturada. Recorra ao extrator de link quando a entrada for HTML e você quiser o contexto da âncora.

Erros comuns

  • Confundir extrator de URL com extrator de link. O extrator de URL lê qualquer texto e executa regex. O extrator de link analisa HTML e lê tags <a>. Use o extrator de URL para logs, JSON e prosa. Use link-extractor para analisar a estrutura de link de uma página da web em tempo real.
  • Esquecer de remover parâmetros de consulta antes de desduplicar para análise. Duas URLs que diferem apenas por ?utm_source= contam como entradas separadas. Se você quiser páginas únicas, execute a saída por uma passagem rápida de planilha para descartar strings de consulta antes de contar.
  • Colar HTML truncado e perder metade dos links. Copiar e colar do "Exibir Fonte da Página" às vezes trunca em 100KB ou corta no meio de uma tag. Use a opção de busca de URL no campo acima em vez disso, que puxa a resposta completa do servidor.
  • Confiar na contagem de deduplicação como contagem de página única. Deduplicação é host mais caminho mais consulta. example.com/page e example.com/page/ são duas entradas mesmo que resolvam para a mesma página. Normalize barras à direita se a exclusividade exata for importante.
  • Executar o extrator em um arquivo de log de 50MB em uma única colagem. Regex do navegador em entradas enormes pode bloquear a guia por 30+ segundos. Divida logs em pedaços de 5MB ou use o modo de busca para URLs individuais.

Dicas avançadas

  • Após a extração, canalize a saída para o link-extractor por URL para obter texto de âncora e atributos rel para cada link. As duas ferramentas se encadeiam naturalmente para auditorias de link completas.
  • Para migrações de SEO, extraia todas as URLs do seu antigo sitemap.xml, execute a mesma extração no novo sitemap e compare as listas para encontrar páginas ausentes. Um site de 5.000 URLs geralmente tem 50-200 redirecionamentos ausentes após um redesign.
  • Use o filtro Ocultar mesmo-domínio ao auditar links de saída de uma única página. Um site de marketing B2B com 80 links internos e 12 links de parceiros externos mostra apenas os 12 externos, tornando a auditoria de parceiros instantânea.
  • Emparelhe isso com o email-extractor ao processar despejos de contatos. O extrator de email captura endereços que a regex mailto do extrator de URL perde, como strings [email protected] brutas sem o prefixo mailto:.
  • Para fluxos de trabalho de desenvolvedor, execute extração em saída git log para encontrar todas as referências externas em mensagens de commit. Um histórico de 2.000 commits geralmente contém 40-80 URLs de referência únicas (tíquetes Jira, PRs GitHub, threads Slack).

Assim que você tiver uma lista limpa de URL, o próximo passo depende do seu objetivo. Para auditoria de link HTML com contexto de âncora, execute cada URL através do link-extractor. Para encontrar informações de contato na mesma entrada, use o email-extractor e phone-number-extractor na mesma colagem. Para crawls baseados em sitemap, o sitemap-checker oferece a visualização XML estruturada que a abordagem regex ignora.

Perguntas frequentes

O que é um extrator de URL?

Um extrator de URL é uma ferramenta que examina qualquer entrada de texto e extrai todas as URLs que ela contém. Usa uma expressão regular para encontrar padrões começando com http, https, ftp, mailto ou www., depois valida cada correspondência contra o analisador URL do navegador para descartar strings malformadas. Após validação, a ferramenta remove duplicatas da lista e agrupa resultados por host. Este extrator BlazeHive manipula arquivos de log de 4.000 linhas, cargas JSON de até alguns megabytes, HTML bruto e prosa colada sem fazer upload de nada para um servidor. Tudo é executado no navegador. Casos de uso comuns incluem triagem de log de segurança, revisão de tíquete de suporte, auditorias de migração de conteúdo e pesquisa competitiva rápida em links de saída de um artigo concorrente. Use o link-extractor quando você especificamente precisar de texto de âncora e sinalizadores nofollow de uma página da web em tempo real.

Como você extrai URLs do texto?

Cole seu texto no campo URL ou cole texto/HTML, escolha um filtro e clique em Extrair URLs. A ferramenta executa um padrão regex sobre sua entrada que corresponde a strings http://, https://, ftp://, mailto: e www. simples. Cada correspondência passa por new URL() para filtrar candidatos malformados, depois a pontuação final como vírgulas, períodos, parênteses e colchetes é removida. A lista desduplicada agrupa por host e mostra uma contagem para cada domínio. Uma thread de email de 200 linhas geralmente produz 5-15 URLs únicas em menos de um segundo. Para extração programática, o mesmo padrão regex funciona em Python (re.findall), JavaScript (String.prototype.matchAll) ou grep com a flag -oE, mas uma ferramenta do navegador oferece filtragem instantânea e agrupamento de host que uma única linha não oferece.

Posso extrair URLs de um arquivo de log?

Sim. Os logs do servidor são uma das entradas mais comuns para este extrator de URL. Cole até alguns megabytes de linhas de log nginx, Apache ou de aplicação na textarea e clique em Extrair URLs. A ferramenta encontra todas as URLs referenciadas no log, remove duplicatas e agrupa por host. Um log de acesso nginx de 4.000 linhas com 12.000 correspondências brutas normalmente se reduz a 80-200 URLs únicas após deduplicação. Para arquivos maiores que 5MB, divida o log em pedaços antes de colar. Se você precisar extrair URLs de logs como parte de um fluxo de trabalho automatizado, o mesmo padrão regex funciona em grep -oE na linha de comando. Use a ferramenta do navegador quando quiser agrupamento visual rápido. Use grep quando quiser canalizar a saída para outro script. Após a extração, execute hosts externos suspeitos através do link-extractor para inspecionar o conteúdo da página real.

Como você extrai URLs de um PDF?

O extrator de URL funciona em texto, portanto, primeiro converta o PDF em texto. No macOS, execute pdftotext input.pdf output.txt na linha de comando (instale via brew install poppler). No Windows ou Linux, use o mesmo utilitário pdftotext do pacote Poppler. Abra o arquivo de texto resultante, copie o conteúdo e cole no campo URL ou cole texto/HTML. PDFs criados a partir de páginas da web geralmente contêm 20-100 URLs. PDFs de documentos nativos como relatórios geralmente contêm 5-20. O extrator captura URLs que abrangem quebras de linha se o PDF as preservar como strings contínuas. Observe PDFs que envolvem URLs longas em múltiplas linhas com hífens. Aquelas se tornam duas URLs quebradas. Se sua saída parecer suspeita, abra o PDF no Preview ou Adobe Reader e use a exportação incorporada "Salvar como Texto", que preserva a continuidade da URL melhor que ferramentas de linha de comando para alguns PDFs.

Como você extrai URLs de um email?

Abra o email, visualize a fonte bruta ou "Mostrar Original" (Gmail) ou "Exibir Fonte" (Outlook) e copie o corpo HTML completo. Cole isso no campo URL ou cole texto/HTML e clique em Extrair URLs. Um email de marketing típico contém 15-40 URLs incluindo pixels de rastreamento, links de cancelamento de inscrição, ícones sociais e links de conteúdo. Escolha o filtro Apenas HTTP/HTTPS para pular o endereço mailto: de resposta. Para Apple Mail ou Thunderbird, você pode copiar o email renderizado diretamente sem visualizar a fonte, mas perderá as URLs ocultas em atributos alt de imagem e pixels de rastreamento. Visualize a fonte para a extração mais completa. Se você processar emails em massa, exporte sua caixa de entrada para formato mbox e execute o arquivo através do extrator em pedaços. O mesmo regex captura URLs em corpos de email de texto simples e HTML igualmente bem.

Como o extrator de URL valida URLs?

Cada correspondência de regex passa pelo construtor new URL() do JavaScript. Se o construtor lançar um erro, o candidato é descartado. Isso filtra strings malformadas como https:// sem host, http://example sem domínio de nível superior e fragmentos parciais. O validador não verifica se a URL é resolvida ou retorna uma resposta 200. Apenas verifica validade sintática. Para verificar se as URLs estão ativas, execute a lista extraída através do http-status-checker um host por vez. A etapa de validação geralmente rejeita 5-10% das correspondências de regex brutas como malformadas. Referências simples www.example.com são normalizadas com um prefixo https:// antes da validação para que passem no analisador. Pontuação final como )., , e ] é removida antes da validação para evitar rejeições falsas de URLs coladas a prosa circundante.

Quais protocolos o extrator de URL suporta?

O extrator corresponde a cinco padrões de protocolo: http://, https://, ftp://, mailto: e www. simples (que é normalizado para https://www.). Isso cobre 95% das URLs encontradas em entradas do mundo real. O extrator não corresponde a tel:, sms:, file://, chrome-extension:// ou outros esquemas específicos do navegador por design. Se você precisar extrair números de telefone de texto que mistura URLs e links tel:, use o phone-number-extractor na mesma entrada. O filtro Apenas HTTP/HTTPS restringe a saída a URLs da web e descarta correspondências mailto: e ftp://. O filtro Todas as URLs mostra tudo. O escopo de 5 protocolos mantém o padrão regex rápido o suficiente para processar entradas multi-megabyte em menos de um segundo em navegadores modernos. Protocolos personalizados podem ser adicionados editando o padrão regex na fonte se você bifurcar a ferramenta.

Como você desuplica URLs?

Deduplicação é executada automaticamente após a extração. A ferramenta compara cada URL por correspondência de string completa incluindo protocolo, host, caminho, consulta e fragmento. Duas URLs que diferem por apenas um caractere contam como entradas separadas. Isso significa que https://example.com/page e https://example.com/page/ são duas entradas (diferença de barra à direita). Também significa que example.com/page?utm_source=email e example.com/page?utm_source=social são duas entradas. Se você quiser páginas únicas independentemente dos parâmetros de consulta, cole a saída em uma planilha, divida em ? e desuplique a coluna somente de caminho. Uma extração bruta de 12.000 correspondências do log do servidor geralmente deuplica para 80-200 URLs únicas, uma redução de 60-150x. A etapa de deduplicação é o que torna o extrator útil para triagem de log. Sem deduplicação, você obtém a contagem de correspondência bruta, que raramente é o número que você deseja.

Como faço para contar URLs em texto?

Cole o texto, clique em Extrair URLs e a ferramenta mostra a contagem de URL única ao lado dos totais do grupo de host. Para contagem de correspondência bruta antes de deduplicação, veja o resumo de resultado que exibe ambos os números. Um artigo de blog de 1.000 palavras geralmente contém 5-20 URLs. Um documento legal de 10 páginas contém 30-80 URLs. Um arquivo de log de servidor contém 50-500 URLs únicas dependendo dos padrões de tráfego. Se você precisar apenas da contagem sem ver as URLs, essa ferramenta ainda oferece a resposta mais rápida. Para contagens programáticas em scripts, use grep -oE 'https?://[^ ]+' input.txt | sort -u | wc -l na linha de comando. A ferramenta do navegador vence em entradas que você já tem em sua área de transferência. A abordagem de linha de comando vence no processamento em lote de 100+ arquivos.

Qual é a diferença entre um extrator de URL e um extrator de link?

Um extrator de URL lê texto bruto com regex e puxa qualquer coisa que pareça uma URL. Funciona em logs, JSON, prosa, HTML quebrado e qualquer entrada não estruturada. Um extrator de link analisa HTML válido com DOMParser e lê tags <a href>, retornando metadados estruturados como texto de âncora, sinalizadores nofollow e classificação interna versus externa. O extrator de URL é primeiro em texto. O link-extractor é HTML-aware. Use o extrator de URL quando sua entrada for confusa ou você não tiver uma URL em tempo real. Use o extrator de link quando quiser auditar a estrutura de link de uma página da web real com contexto de âncora completo. As duas ferramentas se complementam: extraia URLs de um log, depois execute cada URL única através do extrator de link para ver ao que cada página vincula. Juntas, elas cobrem tanto entradas de texto não estruturado quanto HTML estruturado.

O extrator de URL pode classificar links internos versus externos?

O extrator de URL não classifica links por padrão porque não tem conceito de URL de base quando você cola texto bruto. O filtro Ocultar mesmo-domínio faz o próximo melhor: quando você busca uma URL usando o campo acima, a ferramenta conhece o host de origem e pode ocultar URLs apontando para esse mesmo host. Isso oferece uma visualização apenas externa. Para texto colado sem fonte de busca, cada URL conta como externa porque não há URL de base para comparar. Se você precisar de classificação verdadeira de interna versus externa com texto de âncora, use o link-extractor. Ele busca a URL, analisa o HTML e rotula cada tag <a> como interna ou externa com base no host da página de origem. Um post de blog B2B típico tem 80% de links internos e 20% de externos. Um artigo de notícias inverte essa proporção.

Como extrair URLs de HTML?

Cole a fonte HTML bruta no campo URL ou cole texto/HTML e clique em Extrair URLs. A regex captura URLs dentro de <a href>, <img src>, <link href>, <script src>, <iframe src>, chamadas inline CSS url() e URLs em texto simples no corpo HTML. Uma página HTML de 50KB geralmente contém 80-200 URLs únicas em todas essas fontes. Use o filtro Apenas HTTP/HTTPS para focar em URLs da web e pular correspondências mailto: e ftp://. Para HTML onde você especificamente quer apenas os links de âncora e precisa do texto de âncora, use o link-extractor. Ele analisa o DOM e retorna apenas correspondências <a href> com conteúdo de texto. O extrator de URL é mais amplo. O extrator de link é mais preciso para auditorias específicas de âncora. Escolha com base em se você quer toda URL ou apenas os links de âncora.

Qual padrão regex o extrator de URL usa?

O padrão corresponde aos cinco prefixos de protocolo suportados seguidos por caracteres de URL válidos: aproximadamente (?:https?|ftp|mailto):\/\/[^\s<>"]+ mais uma correspondência separada para strings www. simples. O padrão exato trata casos especiais como URLs terminando em pontuação, URLs com parênteses e URLs contendo parâmetros de consulta com caracteres especiais. Após a correspondência, cada candidato passa pela validação new URL(), então o regex pode ser ligeiramente permissivo sem poluir a saída. Se você quiser usar o mesmo padrão fora do navegador, a versão simplificada https?:\/\/[^\s<>"]+ funciona em re.findall Python e grep -oE. O padrão completo com suporte mailto e www requer escape mais cuidadoso. Para a maioria das extrações ad-hoc, o padrão simplificado captura 95% das URLs reais. A ferramenta do navegador usa a versão completa para completude.

O extrator de URL é gratuito?

Sim. Este extrator de URL é gratuito sem cadastro, sem upload e sem limite de taxa. Tudo é executado no seu navegador. Você pode colar até alguns megabytes de texto e extrair URLs em menos de um segundo. A ferramenta não envia sua entrada para um servidor, o que importa ao processar logs ou emails que contêm dados sensíveis. Compare com ferramentas pagas como Screaming Frog (250 URLs livres, depois $259/ano para ilimitado) ou Ahrefs (sem extração de URL gratuita, requer assinatura $99/mês). Essas ferramentas incluem recursos que o extrator BlazeHive não possui, como crawling recursivo e pontuação de SEO. Para extração pura de URL do texto ou HTML, a ferramenta gratuita do navegador cobre o caso de uso. Emparelhe-a com email-extractor e phone-number-extractor para extração de dados de contato completa da mesma entrada, tudo gratuito.

Por que o extrator de URL remove pontuação final?

Porque URLs em prosa frequentemente têm pontuação colada ao final. Uma frase como "Leia o artigo em https://example.com/post." tem o ponto anexado à URL após uma correspondência de regex ingênua. Sem remoção, a URL extraída se torna https://example.com/post. que falha no analisador URL porque o ponto à direita não faz parte do caminho. O extrator remove )., ,, ;, ], >, ", ' e . do final de cada correspondência antes da validação. Isso recupera a URL limpa https://example.com/post. A mesma lógica manipula URLs em markdown como [link](https://example.com) onde o parêntese de fechamento não é parte da URL. Sem remoção de pontuação final, 10-20% das URLs extraídas de prosa falhariam na validação e seriam descartadas. A etapa de remoção é o que torna o extrator confiável em texto do mundo real em vez de apenas arquivos de log limpos.

Ferramentas gratuitas relacionadas

Todas as ferramentas →