
webclaw CLI全命令指南scrape/crawl/map/batch/extract等12个工具一张清单看懂【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclawwebclaw 是一款用 Rust 编写的本地优先网页内容提取工具能把任意网页快速转换成干净 Markdown、JSON 或 LLM 就绪文本。它提供 CLI 命令行、REST API 和 MCP 服务器三种使用方式核心命令包括 scrape、crawl、map、batch、extract 等 12 个工具覆盖单页抓取、站点爬取、URL 地图发现、批量并行、结构化数据提取、页面摘要、变更对比、品牌识别、网页搜索、深度调研、基准测试等完整场景。本指南用一张清单带你快速看懂每个命令的用途与典型用法。一张清单看懂 webclaw CLI 的12个命令先记住这张总表遇到需求时直接对号入座#命令/模式一句话说明典型场景1scrape抓取单个 URL 并提取正文把网页变干净 Markdown2batch并行抓取多个 URL竞品定价页批量入库3crawl递归爬取同域站点文档站整站转 RAG 语料4map只发现 URL不逐页提取先盘点站点结构再抓取5extract用 LLM 把页面转成结构化 JSON抽取商品价格、标题等字段6summarize用 LLM 生成页面摘要快速生成 N 句摘要7diff对比同一页面的两次快照监控竞品页面变更8brand提取颜色、字体、Logo 等品牌资产品牌情报收集9search用 Serper 搜索网页并顺带抓取搜索正文一步到位10research多来源深度调研工作流生成带引用的调研报告11bench单 URL 提取微基准测试对比原始 HTML 与 LLM 输出12watch定时监控页面变化定价页/更新日志变更告警 除search、research等少数依赖托管 API 的模式外绝大多数命令本地运行、无需账号和 API Key这就是 webclaw 本地优先 的核心设计理念见 crates/webclaw-fetch/ 抓取层与 crates/webclaw-core/ 提取层的分离设计。scrape单页抓取是最常用的基础命令webclaw 的默认行为就是 scrape直接给一个 URL即可得到干净的正文内容。webclaw https://example.com --format markdown几个高频参数值得记住--format输出markdown默认、llm、text、json、html五种格式。其中--format llm专门为 AI 代理和 RAG 流水线优化会剔除导航、脚本、广告等噪声大幅压缩 token 消耗--only-main-content只保留article/main主内容区博客文章场景非常好用--include/--exclude用 CSS 选择器精确圈定保留或剔除的区域--file/--stdin不联网直接提取本地 HTML 文件或管道输入的内容--output-dir把结果按 URL 路径存成文件而不是打印到终端。这些参数的定义都在 crates/webclaw-cli/src/main.rs 中参数名与帮助文档一一对应遇到不确定的用法直接webclaw --help即可查看。batch一次抓取多个 URL 的并行模式把多个 URL 直接写在命令行后或使用--urls-file传入每行一个 URL 的文本文件也支持url,filename的 CSV 形式自定义文件名webclaw 就会以并行方式逐个抓取。webclaw https://a.com/pricing https://b.com/pricing https://c.com/pricing任一 URL 失败不会中断整体任务错误会写到 stderr成功的正常输出--output-dir搭配 batch 使用可为每个页面生成独立文件方便批量入库--concurrency控制并发数默认 5--delay控制请求间隔毫秒数默认 100ms对目标站点更友好。批量抓取的结果处理逻辑见 crates/webclaw-cli/src/main.rs 中的print_batch_outputJSON 模式下每个条目包含url result或url error方便脚本消费。crawl递归爬取文档站的整站利器--crawl开启同域递归爬取是构建 RAG 知识库最常用的模式webclaw https://docs.example.com --crawl --depth 2 --max-pages 50关键参数速查参数作用默认值--depth最大链接深度1--max-pages最大页面数0表示不限20--concurrency并发请求数5--delay请求间隔毫秒100--path-prefix只爬某路径前缀如/docs—--include-paths/--exclude-pathsGlob 模式包含/排除路径—--sitemap用 robots.txt sitemap 种子化爬取队列关--crawl-state保存/恢复断点CtrlC 保存进度—两个贴心设计实时进度每抓完一页都会在 stderr 打印一行进度序号、OK/ERR、耗时、字数不会卡住无响应断点续爬用--crawl-state state.json时中途 CtrlC 会保存进度下次用同一参数即可从未完成处继续大站抓取不怕中断。爬取器核心实现在 crates/webclaw-fetch/src/crawler.rssitemap 发现逻辑在 crates/webclaw-fetch/src/sitemap.rs。map先画站点地图再决定抓什么--map只发现 URL 而不提取每页正文输出一个 URL 清单一行一个--format json则为 JSON 数组。它的策略是先读 sitemap若 sitemap 稀疏则自动用爬取补齐--map-limit可限制返回数量。webclaw https://example.com --map典型工作流先用--map盘点整个站点有多少页面、路径结构如何再挑出关键路径交给--crawl或 batch 提取避免盲目爬全站浪费请求。map 的输出逻辑见 crates/webclaw-cli/src/main.rs 中的print_map_output。extract 与 summarize用 LLM 做结构化提取和摘要这两个模式通过--extract-json、--extract-prompt、--summarize参数开启支持本地 Ollama 或 OpenAI/Anthropic 兼容的任意模型# 按 JSON Schema 提取结构化字段 webclaw https://shop.example.com/item --extract-json {price:number,title:string} # 用自然语言提示词提取 webclaw https://news.example.com/a --extract-prompt 提取文章标题、日期和三个要点 # 生成摘要可指定句数默认 3 句 webclaw https://blog.example.com/post --summarize 2模型选择通过环境变量或--llm-provider/--llm-model/--llm-base-url指定各 provider 的实现位于 crates/webclaw-llm/src/providers/ollama、openai、anthropic 等。没有配置 LLM 也不影响其他命令使用——LLM 是可选增强不是依赖。diff 与 watch页面变更监控组合拳diff对比两次抓取快照输出变更状态、字数增量、元数据变化和新增/删除的链接webclaw https://example.com/pricing --format json pricing-old.json webclaw https://example.com/pricing --diff-with pricing-old.jsonwatch则更进一步按固定间隔--watch-interval默认 300 秒反复检查同一页面发现变化就报告 diff并可执行--on-change指定的命令diff JSON 通过 stdin 传入实现竞品价格一变就告警的自动化。两者天然搭配watch 负责持续盯梢diff 负责输出可读的对比结果底层比较算法在 crates/webclaw-core/src/diff.rs。brand一键提取网站的品牌资产--brand会解析页面的 CSS 与元数据输出主色调、字体、Logo 等品牌身份信息自动拉取外链样式表参与分析webclaw https://example.com --brand适合品牌情报收集、竞品视觉风格分析等场景。它复用普通抓取链路fetch_html提取逻辑在 crates/webclaw-core/src/brand.rs。search 与 research搜索和深度调研search子命令用你自己的 Serper API Key 做 Google 搜索--scrape参数会把每条结果页顺带抓取并提取为 Markdown搜索抓取一步完成webclaw search rust async runtime --num 5 --scrapeKey 通过--serper-key或环境变量SERPER_API_KEY提供搜索实现见 crates/webclaw-fetch/src/search.rs。research则是托管 API 提供的多来源深度调研给它一个主题返回完整报告 来源列表 发现要点--deep开启更详尽的长报告模式结果保存为 JSON 文件webclaw electric vehicle battery technology --research ev-battery --deepbench用一张小表看清提取管线省了多少 tokenwebclaw bench url抓取一个页面用与--format llm相同的管线提取后打印一张 ASCII 小表原始 HTML 的 token 数/字节数 vs 提取输出的 token 数/字节数、缩减百分比和耗时。--json输出单行 JSON 方便写进 CI 日志--facts可挂载 benchmarks/facts.json 同款事实清单来显示事实保留率如 4/5 facts preserved。webclaw bench https://example.com --json它是验证LLM 上下文瘦身效果的直观工具实现位于 crates/webclaw-cli/src/bench.rs基准方法详见 benchmarks/methodology.md。常见通用参数代理、Cookie 与云回退最后是一些横跨所有命令的通用能力了解它们能少踩很多坑代理--proxy指定单个代理--proxy-file加载代理池并按请求轮换工作目录存在proxies.txt时还会自动加载。反爬严格的站点建议配合 examples/proxy-backed-crawling/ 的完整教程Cookie--cookie sessionabc或--cookie-file cookies.jsonChrome 扩展导出格式应对登录墙自定义请求头-H Key: Value可重复使用云 API 回退设置WEBCLAW_API_KEY后遇到反爬验证页、GDPR 同意墙或纯 JS 渲染站点时CLI 会自动降级到托管 API 重试无需改变命令--cloud可强制所有请求走云端。总结按场景选命令你的需求首选命令把单个网页变干净 Markdownwebclaw url给 AI / RAG 喂紧凑上下文webclaw url --format llm整站文档入 RAG 库--crawl --depth 2 --max-pages N先摸底站点结构--map批量抓竞品页面多 URL 或--urls-file页面转结构化字段--extract-json/--extract-prompt盯页面变更--watch --on-change品牌视觉情报--brand命令定义、参数细节和默认值都可以随时通过webclaw --help查看源码入口在 crates/webclaw-cli/src/main.rs更多完整工作流示例HTML 转 Markdown 建 RAG、代理爬取、Cloudflare 诊断等在 examples/ 目录下每个子目录都有独立 README值得收藏。【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考