WebsiteArchiver WebsiteArchiver
Dokumentation Crawler Website-Crawler
Auf dieser Seite

Website-Crawler macOS

Der Crawler archiviert ganze Websites statt einzelner Seiten: Er folgt Links, sammelt alle Seiten im gewählten Rahmen, lässt dich die Liste prüfen und lädt dann alles als Offline-Archive herunter, deren Links untereinander funktionieren.

Ein kompletter Crawl: Entdecken, Prüfen, Herunterladen.

Was der Crawler macht

Öffne den Crawler über die Crawler-Taste in der Symbolleiste. Start-URL eingeben, Scope festlegen. Dann arbeitet der Crawler in zwei Durchgängen: Erst entdeckt er Seiten, indem er Links folgt; nach deinem Review lädt er jede Seite als eigenständiges Archiv herunter. Interne Links zwischen den archivierten Seiten werden umgeschrieben, sodass du die ganze Website offline durchblättern kannst, Seite für Seite.

Das Crawler-Fenster.
Das Crawler-Fenster.

Der Crawl läuft in einem eigenen Fenster, und er läuft weiter, wenn du das Fenster schließt. Öffne es jederzeit wieder, um den Fortschritt zu sehen.

Zwei Engines: Statisch & Browser

Statischer DownloadBrowser
TempoSchnell, mehrere Seiten parallelEine Seite nach der anderen
JavaScriptWird nicht ausgeführtVoll gerendert, wie eine normale Erfassung
Ideal fürBlogs, Dokumentationen, klassische WebsitesJS-lastige Seiten, Seiten mit Login/Cookies
OptionenKeineGespeicherte Cookies, JavaScript speichern, Bilder entfernen, nur Markdown

Starte mit der statischen Engine, sie ist deutlich schneller. Kommen Seiten unvollständig heraus, sagt dir der Crawler Bescheid: Für Seiten, die JavaScript zu brauchen scheinen, bietet er an, sie mit der Browser-Engine neu zu laden.

Scope: Tiefe, Limits, Domains

  • Linktiefe: wie viele Klicks von der Startseite entfernt der Crawler Links folgt.
  • Seitenlimit: harte Obergrenze für die Seitenzahl.
  • Subdomains einbeziehen: auch Seiten auf Subdomains archivieren (blog.example.com neben example.com).
  • Externe Domains erlauben: auch Links auf andere Websites verfolgen. Mächtig und schnell ausgeufert, muss deshalb erst in Einstellungen → Erfassung → Crawler freigeschaltet werden.

Ziel: Wähle einen übergeordneten Ordner deiner Bibliothek; der Crawler legt darin einen nach der Website benannten Unterordner für den ganzen Crawl an.

Der Review-Schritt

Gefundene Seiten vor dem Download prüfen.
Gefundene Seiten vor dem Download prüfen.

Nach der Entdeckung siehst du jede gefundene Seite in einem Baum, gruppiert nach Host und Pfad. Wähle ab, was du nicht willst (die 500 Produktvarianten des Shops, die Tag-Seiten, die Druckansichten), und starte dann den Download. Archiviert wird nur, was ausgewählt ist.

Fortschritt, Pause & Wiederholen

Live-Fortschritt mit Zählern.
Live-Fortschritt mit Zählern.

Während des Downloads siehst du Live-Zähler für Gefunden / Gespeichert / Fehlgeschlagen / Übersprungen, die gerade verarbeiteten URLs und eine Liste fehlgeschlagener Seiten. Pause / Fortsetzen und Abbrechen gehen jederzeit; Fehlgeschlagene wiederholen lädt nur die Seiten neu, die schiefgingen.

Crawls in der Bibliothek

Eine Crawl-Gruppe in der Elementliste.
Eine Crawl-Gruppe in der Elementliste.

Die Seiten eines Crawls gehören zusammen, und so behandelt sie auch die Bibliothek: In der Liste falten sie sich zu einer einzigen Crawl-Gruppenzeile zusammen. Ein Klick öffnet die Seiten des Crawls; Rechtsklick zeigt Gruppen-Aktionen: Alle Seiten anzeigen, Bewegen nach oder Crawl löschen (entfernt alle Seiten auf einmal).

Lieber eine flache Liste? Schalte Crawls gruppieren im Sortiermenü ab, oder blende Crawl-Ordner in der Seitenleiste aus: Einstellungen → Erfassung → Crawler → Crawl-Ordner ausblenden.

Crawler-Einstellungen

In Einstellungen → Erfassung → Crawler:

  • Externe Domains erlauben: schaltet die oben beschriebene Scope-Option frei.
  • Crawl-Ordner ausblenden in der Seitenleiste.
  • robots.txt respektieren: die Crawling-Regeln der Website beachten. Standardmäßig aus; empfehlenswert bei fremden, öffentlichen Websites.
  • Politeness-Delay (ms): Pause zwischen Anfragen an dieselbe Website.
  • Parallele Downloads: wie viele Seiten die statische Engine gleichzeitig lädt.
  • Standard-Tiefe und Standard-Seitenlimit für neue Crawls.

Limits der Free-Version

In der Free-Version ist der Crawler auf Tiefe 1 begrenzt, und die Seitenzahl ist durch deine verbleibenden freien Elemente gedeckelt (10 minus bereits Gesichertes). Die Vollversion hebt beide Grenzen auf (siehe Free-Version, Kauf & Lizenz).