WebsiteArchiver WebsiteArchiver
Documentation Crawler Crawler de sites web
Sur cette page

Crawler de sites web macOS

Le crawler archive des sites web entiers plutôt que des pages isolées : il suit les liens, rassemble toutes les pages comprises dans la portée, vous laisse vérifier la liste, puis les télécharge toutes sous forme d'archives hors ligne dont les liens renvoient les uns aux autres.

Un crawl complet : découverte, vérification, téléchargement.

Ce que fait le crawler

Ouvrez le crawler avec le bouton Crawler de la barre d'outils. Saisissez une URL de départ, définissez la portée, et le crawler travaille en deux passes : il découvre d'abord les pages en suivant les liens, puis, après votre vérification, il télécharge chaque page sous forme d'archive autonome. Les liens internes entre les pages archivées sont réécrits, si bien que vous pouvez parcourir tout le site hors ligne, page après page.

La fenêtre du crawler.
La fenêtre du crawler.

Le crawl s'exécute dans sa propre fenêtre, et il continue de tourner si vous fermez celle-ci ; rouvrez-la à tout moment pour suivre la progression.

Deux moteurs : statique et navigateur

Téléchargement statiqueNavigateur
VitesseRapide, plusieurs pages en parallèleUne page à la fois
JavaScriptNon exécutéEntièrement rendu, comme une capture normale
Idéal pourBlogs, documentations, sites web classiquesSites chargés en JS, pages nécessitant connexion ou cookies
OptionsAucuneCookies enregistrés, enregistrer le JavaScript, supprimer les images, Markdown uniquement

Commencez par le moteur statique. Il est nettement plus rapide. Si des pages ressortent incomplètes, le crawler vous le signale : pour celles qui semblent avoir besoin de JavaScript, il propose de les recharger avec le moteur navigateur.

Portée : profondeur, limites, domaines

  • Profondeur de liens : à combien de clics de la page de départ le crawler suit encore les liens.
  • Limite de pages : plafond strict sur le nombre de pages.
  • Inclure les sous-domaines : archiver aussi les pages des sous-domaines de l'hôte de départ (blog.example.com à côté de example.com).
  • Autoriser les domaines externes : suivre aussi les liens vers d'autres sites web. C'est puissant et vite excessif, l'option doit donc d'abord être déverrouillée dans Réglages → Capture → Crawler.

Destination : choisissez un dossier parent de votre bibliothèque ; le crawler y crée un sous-dossier nommé d'après le site pour l'ensemble du crawl.

L'étape de vérification

Vérification des pages découvertes avant le téléchargement.
Vérification des pages découvertes avant le téléchargement.

Après la découverte, vous voyez chaque page trouvée dans une arborescence, groupée par hôte et par chemin. Décochez tout ce dont vous ne voulez pas (les 500 variantes de produits de la boutique, les pages de tags, les versions imprimables), puis lancez le téléchargement. Seul ce que vous avez sélectionné est archivé.

Progression, pause et réessai

Progression du crawl en direct avec les compteurs.
Progression du crawl en direct avec les compteurs.

Pendant le téléchargement, vous voyez des compteurs en direct pour Trouvées / Enregistrées / Échouées / Ignorées, les URL en cours de traitement et la liste des pages en échec. Vous pouvez Suspendre / Reprendre ou Annuler à tout moment, et Réessayer les échecs relance uniquement les pages qui ont échoué.

Les crawls dans la bibliothèque

Une ligne de groupe de crawl dans la liste des éléments.
Une ligne de groupe de crawl dans la liste des éléments.

Les pages d'un crawl forment un tout, et la bibliothèque les traite comme tel : elles se replient en une seule ligne de groupe de crawl dans la liste des éléments. Cliquez dessus pour parcourir les pages du crawl ; le clic droit donne les actions de groupe : Afficher toutes les pages, Déplacer vers un dossier… ou Supprimer le crawl (supprime toutes les pages du crawl d'un coup).

Vous préférez une liste à plat ? Désactivez le regroupement avec l'option Grouper les crawls du menu de tri, ou masquez les dossiers de crawl dans la barre latérale avec Réglages → Capture → Crawler → Masquer les dossiers de crawl.

Réglages du crawler

Dans Réglages → Capture → Crawler :

  • Autoriser les domaines externes : déverrouille l'option de portée décrite ci-dessus.
  • Masquer les dossiers de crawl dans la barre latérale.
  • Respecter robots.txt : suivre les règles de crawl du site. Désactivé par défaut ; activez-le quand vous crawlez des sites web publics qui ne vous appartiennent pas.
  • Délai entre les requêtes (ms) : pause entre deux requêtes vers le même site.
  • Téléchargements parallèles : combien de pages le moteur statique récupère en même temps.
  • Profondeur de liens par défaut et limite de pages par défaut pour les nouveaux crawls.

Limites de la version gratuite

Dans la version gratuite, le crawler est limité à la profondeur 1, et le nombre de pages est plafonné par vos éléments gratuits restants (10 moins ce que vous avez déjà enregistré). La version complète lève les deux limites. Voir Version gratuite, achat et licence.