网站抓取器 macOS
抓取器归档的是整个网站,而不是单个页面:它沿着链接前进,收集范围内的每一个页面,让你审阅这份列表,然后把它们全部下载成离线存档,存档之间的链接互相指向。
抓取器的作用
点按工具栏上的抓取器按钮打开抓取器。输入起始 URL,设定范围,抓取器便分两轮工作:先沿着链接发现页面,在你审阅之后再把每个页面下载成自包含的存档。已归档页面之间的内部链接会被改写,因此你可以离线浏览整个网站,一页接一页。

抓取任务在自己的窗口中运行,关掉那个窗口它也会继续跑,随时重新打开就能查看进度。
两种引擎:静态与浏览器
| 静态下载 | 浏览器 | |
|---|---|---|
| 速度 | 快,多个页面并行 | 一次一个页面 |
| JavaScript | 不执行 | 完整渲染,和普通捕获一样 |
| 最适合 | 博客、文档、传统网站 | JS 密集的网站、需要登录或 Cookie 的页面 |
| 选项 | 无 | 已保存的 Cookie、保存 JavaScript、移除图片、仅保存为 Markdown |
先从静态引擎开始,它快得多。如果页面存下来不完整,抓取器会告诉你:对于看起来需要 JavaScript 的页面,它会提议用浏览器引擎重新加载。
范围:深度、上限、域名
- 链接深度:抓取器从起始页面出发最多跟进的链接层数。
- 页面上限:页面数量的硬性上限。
- 包含子域名:起始主机的子域名上的页面也一并归档(
blog.example.com会和example.com一起收进来)。 - 允许外部域名:指向其他网站的链接也跟进。这个开关很强,也很容易失控,因此必须先在“设置”→“捕获”→“抓取器”中解锁。
目标位置:从资料库中挑一个上级文件夹,抓取器会在其中为整个抓取任务新建一个以网站命名的子文件夹。
审阅步骤

发现阶段结束后,你会看到所有找到的页面排成一棵树,按主机和路径分组。取消勾选你不想要的部分(商店里 500 个商品变体、标签页面、打印视图),然后开始下载。只有勾选的内容才会被归档。
进度、暂停与重试

下载期间,你会看到已找到 / 已保存 / 失败 / 已跳过的实时计数、当前正在处理的 URL,以及失败页面的列表。你随时可以“暂停 / 继续”或“取消”,“重试失败项”只会重新运行失败的那些页面。
资料库中的抓取任务

一次抓取任务的页面本就属于一体,资料库也这样对待它们:在项目列表中,它们会折叠成单独一行抓取分组。点按它即可浏览该抓取任务的页面,右键点按可以看到分组操作:“显示所有页面”、“移动到”或“删除抓取”(一次移除该抓取任务的所有页面)。
更喜欢平铺列表?在排序菜单里关掉“分组抓取”开关,或者用“设置”→“捕获”→“抓取器”→“隐藏抓取文件夹”把抓取文件夹从侧边栏中隐藏起来。
抓取器设置
在“设置”→“捕获”→“抓取器”中:
- 允许外部域名:解锁上面介绍的范围选项。
- 在侧边栏中隐藏抓取文件夹。
- 遵循 robots.txt:尊重网站自己的抓取规则。默认关闭,抓取不属于你的公开网站时把它打开。
- 请求之间的延迟(ms):对同一网站的两次请求之间的停顿。
- 并行下载:静态引擎同时抓取多少个页面。
- 新抓取任务的默认链接深度与默认页面上限。
免费版的限制
在免费版中,抓取器最深只能到深度 1,页面数量也受你剩余的免费项目数量约束(10 减去已经保存的数量)。完整版取消这两项限制。参见免费版、购买与许可。