Auf dieser Seite
Website-Crawler macOS
Der Crawler archiviert ganze Websites statt einzelner Seiten: Er folgt Links, sammelt alle Seiten im gewählten Rahmen, lässt dich die Liste prüfen und lädt dann alles als Offline-Archive herunter, deren Links untereinander funktionieren.
Was der Crawler macht
Öffne den Crawler über die Crawler-Taste in der Symbolleiste. Start-URL eingeben, Scope festlegen. Dann arbeitet der Crawler in zwei Durchgängen: Erst entdeckt er Seiten, indem er Links folgt; nach deinem Review lädt er jede Seite als eigenständiges Archiv herunter. Interne Links zwischen den archivierten Seiten werden umgeschrieben, sodass du die ganze Website offline durchblättern kannst, Seite für Seite.

Der Crawl läuft in einem eigenen Fenster, und er läuft weiter, wenn du das Fenster schließt. Öffne es jederzeit wieder, um den Fortschritt zu sehen.
Zwei Engines: Statisch & Browser
| Statischer Download | Browser | |
|---|---|---|
| Tempo | Schnell, mehrere Seiten parallel | Eine Seite nach der anderen |
| JavaScript | Wird nicht ausgeführt | Voll gerendert, wie eine normale Erfassung |
| Ideal für | Blogs, Dokumentationen, klassische Websites | JS-lastige Seiten, Seiten mit Login/Cookies |
| Optionen | Keine | Gespeicherte Cookies, JavaScript speichern, Bilder entfernen, nur Markdown |
Starte mit der statischen Engine, sie ist deutlich schneller. Kommen Seiten unvollständig heraus, sagt dir der Crawler Bescheid: Für Seiten, die JavaScript zu brauchen scheinen, bietet er an, sie mit der Browser-Engine neu zu laden.
Scope: Tiefe, Limits, Domains
- Linktiefe: wie viele Klicks von der Startseite entfernt der Crawler Links folgt.
- Seitenlimit: harte Obergrenze für die Seitenzahl.
- Subdomains einbeziehen: auch Seiten auf Subdomains archivieren (
blog.example.comnebenexample.com). - Externe Domains erlauben: auch Links auf andere Websites verfolgen. Mächtig und schnell ausgeufert, muss deshalb erst in Einstellungen → Erfassung → Crawler freigeschaltet werden.
Ziel: Wähle einen übergeordneten Ordner deiner Bibliothek; der Crawler legt darin einen nach der Website benannten Unterordner für den ganzen Crawl an.
Der Review-Schritt

Nach der Entdeckung siehst du jede gefundene Seite in einem Baum, gruppiert nach Host und Pfad. Wähle ab, was du nicht willst (die 500 Produktvarianten des Shops, die Tag-Seiten, die Druckansichten), und starte dann den Download. Archiviert wird nur, was ausgewählt ist.
Fortschritt, Pause & Wiederholen

Während des Downloads siehst du Live-Zähler für Gefunden / Gespeichert / Fehlgeschlagen / Übersprungen, die gerade verarbeiteten URLs und eine Liste fehlgeschlagener Seiten. Pause / Fortsetzen und Abbrechen gehen jederzeit; Fehlgeschlagene wiederholen lädt nur die Seiten neu, die schiefgingen.
Crawls in der Bibliothek

Die Seiten eines Crawls gehören zusammen, und so behandelt sie auch die Bibliothek: In der Liste falten sie sich zu einer einzigen Crawl-Gruppenzeile zusammen. Ein Klick öffnet die Seiten des Crawls; Rechtsklick zeigt Gruppen-Aktionen: Alle Seiten anzeigen, Bewegen nach oder Crawl löschen (entfernt alle Seiten auf einmal).
Lieber eine flache Liste? Schalte Crawls gruppieren im Sortiermenü ab, oder blende Crawl-Ordner in der Seitenleiste aus: Einstellungen → Erfassung → Crawler → Crawl-Ordner ausblenden.
Crawler-Einstellungen
In Einstellungen → Erfassung → Crawler:
- Externe Domains erlauben: schaltet die oben beschriebene Scope-Option frei.
- Crawl-Ordner ausblenden in der Seitenleiste.
- robots.txt respektieren: die Crawling-Regeln der Website beachten. Standardmäßig aus; empfehlenswert bei fremden, öffentlichen Websites.
- Politeness-Delay (ms): Pause zwischen Anfragen an dieselbe Website.
- Parallele Downloads: wie viele Seiten die statische Engine gleichzeitig lädt.
- Standard-Tiefe und Standard-Seitenlimit für neue Crawls.
Limits der Free-Version
In der Free-Version ist der Crawler auf Tiefe 1 begrenzt, und die Seitenzahl ist durch deine verbleibenden freien Elemente gedeckelt (10 minus bereits Gesichertes). Die Vollversion hebt beide Grenzen auf (siehe Free-Version, Kauf & Lizenz).