Webseiten-URL-Extraktor
- Was ist eine URLs?
- Aus welchen Bestandteilen besteht eine URLs?
Funktionen
- Webseitenanalyse: Automatische Extraktion aller URLs von einer Webseite.
- Filterung: Nur vollständige Links (z. B. beginnend mit
http) werden angezeigt.
- Einfaches Interface: Eingabefeld für die URLs und eine klare Liste der extrahierten Links.
Anleitung
1. Öffnen der Anwendung
- Zur Webseiten-URL-Extraktor-App auf Hugging Face navigieren.
2. Eingabemethode wählen
- Eingabemethode auswählen: URLs oder HTML-Datei hochladen.
3. URLs extrahieren
URL-Eingabemethode:
- URL der Webseite in das Eingabefeld eingeben (z. B.
https://example.com). - Auf die Schaltfläche “URLs extrahieren” klicken.
- Die App extrahiert alle Links von der angegebenen Webseite und zeigt sie an. Nur vollständige Links, die mit
httpbeginnen, werden angezeigt.
HTML-Datei hochladen:
- HTML-Datei hochladen, indem auf “HTML-Datei hochladen” geklickt und die Datei ausgewählt wird.
- Auf die Schaltfläche “URLs extrahieren” klicken.
- Die App extrahiert alle Links aus der hochgeladenen HTML-Datei und zeigt sie an. Nur vollständige Links, die mit
httpbeginnen, werden angezeigt.
Blick in den Quelltext:
links = [a.get('href') for a in soup.find_all('a', href=True)]Der Code extrahiert alle URLs aus den <a>-Tags eines HTML-Dokuments und speichert sie in der Liste links.
- Diese Methode durchsucht das HTML-Dokument nach allen
soup.find_all('a', href=True)<a>-Tags, die ein href-Attribut besitzen. soup ist dabei ein BeautifulSoup-Objekt, das das HTML-Dokument repräsentiert. - Für jedes gefundene
a.get('href')<a>-Tag wird der Wert des href-Attributs extrahiert. - Die Auflistungsfunktion wiederholt die Extraktion für jeden Link im Dokument und erstellt eine Liste aller href-Werte (URLs) der gefundenen
[a.get('href') for a in soup.find_all('a', href=True)]<a>-Tags.
4. Ergebnisse anzeigen
- Die extrahierten URLs werden in einer übersichtlichen Liste angezeigt. Die Links können direkt angeklickt werden, um sie zu öffnen.
Fazit
Das Webseiten-URL-Extraktor-Tool bietet verdeutlicht das Filtern von Links auf Webseiten oder aus HTML-Dateien, indem es nur vollständige URLs darstellt.
Eine URL (Uniform Resource Locator) ist die Adresse eines bestimmten Dokuments oder Ressourcen im Internet. Sie dient dazu, Webanwendungen und -dienste eindeutig zu identifizieren und darauf zuzugreifen.
Eine typische URL besteht aus mehreren Teilen:
Schema: Gibt das Protokoll an, das verwendet wird, um die Ressource zu erreichen (z.B.
http,https,ftp).Host: Der Name oder die IP-Adresse des Servers, auf dem die Ressource gespeichert ist (z.B.
example.com).Port: Optional; spezifiziert den Port, über den die Verbindung hergestellt wird, wenn es nicht der Standardport ist (z.B.
80für HTTP oder443für HTTPS).Pfad: Zeigt den spezifischen Ort der Ressource auf dem Server an (z.B.
/pfad/zur/ressource.html).Query-Parameter: Optional; verwendet, um zusätzliche Daten an den Server zu übergeben, oft nach einem
?(z.B.?id=123&name=test).Fragment: Optional; identifiziert einen bestimmten Teil der Ressource, häufig verwendet in HTML-Dokumenten für interne Navigation (z.B.
#abschnitt).
https://www.example.com:443/pfad/zur/ressource.html?id=123&name=test#abschnitt
- Schema:
https - Host:
www.example.com - Port:
443 - Pfad:
/pfad/zur/ressource.html - Query-Parameter:
id=123&name=test - Fragment:
abschnitt
Mit dieser Struktur kann ein Browser oder ein anderes Netzwerkprogramm die genaue Adresse einer Ressource im Internet bestimmen und darauf zugreifen.
Anwendungsfall
Dead Link Checker ist ein Online-Tool das nicht funktionierende Links (Dead Links) auf Webseiten identifiziert. An diesem Fall ist erkennbar wie eine einfache Anwendung, wie der URL-Extraktor, als Bestandteil in einer Geschäftsanwendung eingesetzt werden kann.