ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

HTTrack 网站镜像完整指南:三步离线保存任意网站,从零到精通

HTTrack 网站镜像完整指南:三步离线保存任意网站,从零到精通

HTTrack 网站镜像完整指南:三步离线保存任意网站,从零到精通

【免费下载链接】httrackHTTrack Website Copier, copy websites to your computer (Official repository)项目地址: https://gitcode.com/gh_mirrors/ht/httrack

你在深夜赶一份离线参考文档,翻遍整个浏览器缓存却只找到零散的图片——这种场景,是不是很眼熟?更常见的是:即将出差、断网在即,却想把整个技术文档站、产品官网甚至整本在线教程装进笔记本里随身带走。

HTTrack Website Copier(HTTrack 网站镜像工具)就是为这个问题而生的免费开源软件。它会把目标网站完整"搬"到你的电脑上——HTML 页面、CSS 样式、图片、脚本全部保留,连目录结构和相对链接都被原样重建。本地双击打开首页,点哪都能跳,跟在线的体验几乎一模一样。更关键的是,它完全免费、跨平台支持 Windows / Linux / macOS,且源码完全开放。

HTTrack 会实时展示每个文件的接收进度、传输速率和连接状态


一、离线场景下,HTTrack 比"另存网页"强在哪

很多人习惯用浏览器"另存为"保存网页,但这种方式有三个硬伤:只保存当前这一页、图片脚本常常丢、链接全部失效。HTTrack 解决了这三个痛点:

对比项浏览器"另存为"HTTrack 网站镜像
覆盖范围单页整站(递归抓取全部链接)
资源文件经常遗漏图片 / CSS / JS 一并保存
链接结构全部指向在线地址重建为本地相对链接
断点续传支持,中断后继续
增量更新只下载新增/变更内容
多站点合并支持多个站点共享链接

再叠加三个让它成为"杀手级"工具的能力:

  1. 智能增量更新:定期备份网站时,只需下载有变化的文件,节省带宽与时间。
  2. 精细过滤规则:可以用+/-规则精确控制"要什么、不要什么"。
  3. 完全命令行化:支持脚本化、定时任务自动化,这是 GUI 工具做不到的。

一句话要点:HTTrack 的定位是"整站离线备份方案",而不是单页抓取工具,这正是它 20 多年来持续活跃的原因。


二、安装:三条路选一条,五分钟跑通

方式一:发行版软件源(最快)

# Ubuntu / Debian sudo apt install httrack # Fedora sudo dnf install httrack # macOS(Homebrew) brew install httrack

方式二:源码编译(想尝鲜最新特性)

git clone https://gitcode.com/gh_mirrors/ht/httrack cd httrack ./configure --prefix=$HOME/usr make -j8 make install

方式三:使用自带 GUI 版 WebHTTrack

某些发行版会把图形界面拆成单独包,比如 Debian 系的webhttrack。装上后从应用菜单启动即可,界面操作适合新手。

安装方式适合人群耗时难度
软件源绝大多数用户1 分钟
源码编译开发者、追新党5-10 分钟
图形界面不爱敲命令的用户1 分钟

要点:日常使用首选软件源安装;想研究代码、跑最新版再考虑源码编译。


三、第一次镜像:图形界面的三步走

图形界面 WebHTTrack 的核心流程可以压缩成三步:

第 1 步:填写项目信息与目标网址

启动后填上项目名、保存路径和目标 URL,认证字段留空即可,点击确认进入选项页。

填写项目名称、存储路径与目标网站地址,即可开始镜像*

第 2 步:调整关键选项(默认值其实已经很聪明)

点击"Set options"打开选项卡。对新手来说,只需关注三个位置:

  • Limits(限制):设置最大深度、最大下载量、限速,防止镜像失控。
  • Spider(蜘蛛):控制 Cookie、robots.txt 遵守程度与 URL 规整策略。
  • Links(链接):决定是否抓取链接旁的非 HTML 文件(如压缩包、图片)。

Limits 选项卡可精确控制镜像深度、文件大小与传输速率

第 3 步:启动并等待完成

确认后任务开始,界面会滚动显示每个文件的请求与接收状态,底部可随时中止。

实时统计已保存字节、传输速率、扫描链接数与错误数

完成后点击"Browse Mirrored Website"即可在浏览器中离线浏览整站。

镜像完成后可直接浏览本地网站或查看日志确认完整性

要点:GUI 的默认设置足够完成 80% 的镜像任务,选项页只在需要精调时才动。


四、命令行进阶:把镜像变成一条命令

4.1 最常用的四条命令

# 基本镜像:保存到指定目录 httrack https://example.com -O /home/you/mirrors # 限制深度并静默运行 httrack https://example.com -O /home/you/mirrors -r3 -%v # 增量更新:只下载新增与变更文件 httrack https://example.com -O /home/you/mirrors -%v --update # 断点续传:中断后接着抓 httrack -i -O /home/you/mirrors

4.2 过滤规则:精确控制抓什么

# 只要 HTML 与 CSS,跳过图片与视频 httrack https://example.com -O ./m -+*.html -+*.htm -+*.css -*.jpg -*.png -*.mp4 # 只允许 example.com 域内资源 httrack https://example.com -O ./m +*.example.com/* -*

要点:+规则表示"允许下载",-规则表示"拒绝下载",二者可自由组合。

4.3 常用参数速查表

参数作用示例
-O指定镜像保存路径-O ./backup
-rN链接抓取深度-r2表示跟踪两层链接
-cN并发连接数-c8同时 8 个连接
-mN单个非 HTML 文件大小上限-m2000000
-MN整站下载总量上限-M500000000
-EN最大耗时(秒)-E3600一小时
-AN限速(字节/秒)-A100000约 100KB/s
-%v实时显示下载文件名默认建议开启
-sN遵守 robots.txt 的程度-s2完全遵守
--update增量更新已有镜像配合-O使用
--spider只扫描链接不保存内容检查死链用

要点:-O指定目录、--update增量、-rN控制深度,这三板斧覆盖了 90% 的需求。


五、避坑指南:镜像失败最常见的五个原因

坑 1:只抓到首页,点进去全是空的多半是深度限制太死。把-r调大,或用-r9999(默认值)表示不限制深度。

坑 2:下载一半就停了网络抖动导致连接被重置。用-TN调大超时时间、-RN增加重试次数,再用--update续传。

坑 3:抓下来一堆无关的外部链接内容忘了限定域名范围。用+*.example.com/*规则把范围锁死,外部资源一律跳过。

坑 4:登录后才能看的页面抓不下来先手动导出浏览器的 Cookie 文件,再用-%K cookies.txt导入,配合-F "你的User-Agent"伪装浏览器标识。

坑 5:镜像占满硬盘-mN限制单文件大小、-MN限制总量、-A*限速,三个参数三保险。

要点:绝大多数镜像失败都可以归结为"深度不够、范围失控、连接中断",对应参数逐一排查即可。


六、实战场景:六种典型玩法

场景 1:离线技术文档库

httrack https://docs.python.org/3/ -O ~/docs/python -r5 -%v

把常用文档镜像到本地,飞机上、地铁里随时查阅。

场景 2:网站定期备份归档

0 2 * * 0 httrack https://important-site.com -O /backups/site -%v --update -X

每周日凌晨两点自动增量更新,-X同时清理镜像中已消失的旧文件。

场景 3:研究资料批量下载

httrack https://research-hub.example -O ~/research -r2 -%v -*.pdf

只抓页面骨架、跳过 PDF 原文,先看目录再决定下载哪些论文。

场景 4:把多个相关站点合并镜像

httrack https://site-a.com https://site-b.com -O ./docs -%v +*.site-a.com/* +*.site-b.com/*

两个站共享链接时也能在一个项目里保持结构完整。

场景 5:镜像到可搜索索引

httrack https://example.com -O ./m -%v -%I

-%I生成可搜索索引,离线也能全文检索镜像内容。

场景 6:抓成 WARC 存档

httrack https://example.com -O ./m -%v -%r

-%r输出符合 ISO-28500 标准的 WARC/1.1 归档,适合做长期数字存档。

要点:先明确"我要拿镜像干什么",再选命令——查文档选深度、做备份选增量、做存档选 WARC。


七、三句话总结

  1. HTTrack 是一个免费开源的整站离线镜像工具,跨平台、可 GUI 可命令行,能把任意网站连同资源与链接结构完整保存到本地。
  2. 入门只记三板斧-O指定目录、--update增量更新、-rN控制深度,配合过滤规则即可应对绝大多数场景。
  3. 用好它要守两条底线:遵守目标网站的 robots.txt 与版权条款,只镜像允许公开访问的内容;镜像完成后记得用日志确认无缺失、无报错。

无论你是想给技术文档建个离线副本,还是为公司站点做定期备份,HTTrack 都能让你在断网时照样"云游四海"。现在就去把第一份网站镜像跑起来吧。🚀

使用提醒:请在下载前阅读目标网站的 robots.txt 与使用条款,尊重内容版权,不要镜像任何需要授权访问或禁止抓取的站点。

【免费下载链接】httrackHTTrack Website Copier, copy websites to your computer (Official repository)项目地址: https://gitcode.com/gh_mirrors/ht/httrack

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表