Was dieser URL-Extractor aus Rohtext zieht
Der Extractor findet http, https, ftp, mailto und nackte www.-Muster in jeder Eingabe, die du gibst. Das deckt 95 % der echten Links ab, die in Server-Logs, E-Mails des Kundensupports, exportierten Chat-Threads und eingefügten Artikeln vorkommen. Nackte www.example.com-Referenzen werden zu https://www.example.com normalisiert, bevor sie validiert werden, damit sie den Parse-Schritt überstehen. Nachfolgende Satzzeichen, die sich oft an URLs in Prosa anheften – wie )., ,, ; und ] – werden vor dem Speichern des Links entfernt.
Nach der Extraktion läuft jeder Kandidat durch new URL(). Alles, das die Analyse nicht besteht, wird gelöscht. Das filtert fehlerhafte Strings wie https:// ohne Host oder http://example ohne TLD. Die bereinigte Liste wird dann dedupliziert und nach Host sortiert, damit du siehst, welche Domains am häufigsten vorkommen. Ein 4.000-zeiliges nginx-Access-Log mit 12.000 rohen Matches reduziert sich typischerweise auf 80–200 eindeutige URLs nach der Deduplizierung.
So verwendest du diesen URL-Extractor
- Gib eine URL ein oder füge Text/HTML ein. Werfe ein Server-Log, JSON-Payload, E-Mail-Export, Prosa-Absatz oder rohes HTML hinein. Du kannst auch eine URL in das Feld oben eingeben und auf Fetch klicken, um das HTML dieser Seite direkt zu laden.
- Wähle einen Filter. Wähle „Alle URLs", um alles zu sehen, „Nur HTTP/HTTPS", um mailto- und ftp-Matches zu überspringen, oder „Gleiche Domain ausblenden", um Links zur eigenen Host der Quellseite zu unterdrücken.
- Klicke auf „URLs extrahieren". Das Tool gibt eine deduplizierte Liste zurück, gruppiert nach Host, mit einer Anzahl neben jeder Domain und einer Kopier-/Download-Option für die bereinigte Ausgabe.
Probiere das mit einem Stripe-Webhook-Log. Füge 200 Zeilen ein, die Referenzen wie https://api.stripe.com/v1/charges/ch_3O2, https://yourapp.com/webhooks/stripe und mailto:[email protected] enthalten. Stelle den Filter auf „Nur HTTP/HTTPS". Der Extractor gibt drei eindeutige URLs zurück, gruppiert unter zwei Hosts: api.stripe.com (1 Link) und yourapp.com (1 Link). Der mailto-Match ist verborgen. Schalte den Filter zurück auf „Alle URLs" und der mailto erscheint wieder in seiner eigenen Gruppe.
Warum ein textgestützter URL-Extractor DOM-Parsing für chaotische Eingaben schlägt
Die meisten Link-Extractors erfordern gültiges HTML und parsen das DOM, um <a href>-Tags zu finden. Das funktioniert für saubere Web-Seiten, bricht aber bei Log-Dateien, JSON, Klartext und defektem HTML, wo Anker fehlen oder fehlerhaft sind, zusammen. Ein regex-basierter URL-Extractor liest die Rohdaten und findet alles, das wie eine URL aussieht, unabhängig von der Struktur. Das macht ihn zum richtigen Werkzeug für Sicherheits-Audits, Support-Ticket-Triage, Content-Migrationen und jedes Szenario, in dem die Eingabe keine gerenderte Web-Seite ist.
Wenn du Anchor-Text, nofollow-Flags oder interne-vs-externe Klassifizierung von einer echten Web-Seite brauchst, nutze stattdessen den Link-Extractor. Dieses Tool ruft die URL ab, parsed das DOM mit DOMParser und gibt strukturierte Anchor-Metadaten zurück. Nutze den URL-Extractor, wenn die Eingabe unstrukturiert ist. Nutze den Link-Extractor, wenn die Eingabe HTML ist und du den Anchor-Kontext brauchst.
Häufige Fehler
- URL-Extractor mit Link-Extractor verwechseln. Der URL-Extractor liest jeden Text und führt Regex aus. Der Link-Extractor parsed HTML und liest
<a>-Tags. Nutze den URL-Extractor für Logs, JSON und Prosa. Nutze Link-Extractor zum Analysieren der Link-Struktur einer live Web-Seite. - Vergessen, Query-Parameter vor der Deduplizierung für Analytics zu entfernen. Zwei URLs, die sich nur durch
?utm_source=unterscheiden, zählen als separate Einträge. Wenn du eindeutige Seiten willst, führe die Ausgabe durch einen schnellen Spreadsheet-Durchlauf, um Query-Strings vor dem Zählen zu löschen. - Abgeschnittenes HTML einfügen und die Hälfte der Links verpassen. Copy-Paste aus „Seitenquelle anzeigen" wird manchmal bei 100 KB abgeschnitten oder schneidet in der Mitte eines Tags ab. Nutze stattdessen die URL-Fetch-Option im Feld oben, die die vollständige Server-Response zieht.
- Die Deduplizierungs-Anzahl als Unique-Page-Count vertrauen. Deduplizierung ist Host plus Pfad plus Query.
example.com/pageundexample.com/page/sind zwei Einträge, obwohl sie auf dieselbe Seite führen. Normalisiere Slashes am Ende, wenn exakte Eindeutigkeit wichtig ist. - Den Extractor auf eine 50 MB Log-Datei in einem Paste ausführen. Browser-Regex bei großen Eingaben kann den Tab für 30+ Sekunden einfrieren. Teile Logs in 5 MB große Chunks auf oder nutze den Fetch-Modus für einzelne URLs.
Fortgeschrittene Tipps
- Nach der Extraktion leite die Ausgabe in den Link-Extractor nach URL weiter, um Anchor-Text und rel-Attribute für jeden Link zu erhalten. Die beiden Tools verbinden sich natürlich für vollständige Link-Audits.
- Für SEO-Migrationen: Extrahiere jede URL aus deiner alten sitemap.xml, führe dieselbe Extraktion auf der neuen Sitemap durch und vergleiche die Listen, um fehlende Seiten zu finden. Eine 5.000-URL-Site hat üblicherweise 50–200 fehlende Redirects nach einem Redesign.
- Nutze den Filter „Gleiche Domain ausblenden", wenn du ausgehende Links von einer einzelnen Seite auditierst. Eine B2B-Marketing-Site mit 80 internen Links und 12 externen Partner-Links zeigt nur die 12 externen Links, wodurch das Partner-Audit sofort möglich wird.
- Kombiniere das mit dem Email-Extractor, wenn du Contact-Dumps verarbeitest. Der Email-Extractor findet Adressen, die der mailto-Regex des URL-Extractors übersieht, wie nackte
[email protected]-Strings ohne dasmailto:-Präfix. - Für Developer-Workflows: Führe die Extraktion auf git-log-Ausgabe durch, um jede externe Referenz in Commit-Nachrichten zu finden. Eine 2.000-Commit-Historie enthält üblicherweise 40–80 eindeutige Referenz-URLs (Jira-Tickets, GitHub-PRs, Slack-Threads).
Sobald du eine bereinigte URL-Liste hast, hängt der nächste Schritt von deinem Ziel ab. Für HTML-Link-Auditing mit Anchor-Kontext: Führe jede URL durch den Link-Extractor. Um Kontaktinfo in derselben Eingabe zu finden: Nutze den Email-Extractor und Phone-Number-Extractor auf demselben Paste. Für Sitemap-basierte Crawls: Der Sitemap-Checker gibt dir die strukturierte XML-Ansicht, die der Regex-Ansatz überspringt.