ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

wigolo extract 完全指南:快速掌握表格、JSON-LD、命名Schema与自定义Schema提取

wigolo extract 完全指南:快速掌握表格、JSON-LD、命名Schema与自定义Schema提取 wigolo extract 完全指南快速掌握表格、JSON-LD、命名Schema与自定义Schema提取【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolowigolo extract是开源项目 wigolo 内置的结构化数据提取工具支持从任意网页或你直接传入的 HTML中提取表格、JSON-LD、键值对、自定义 Schema 字段等结构化数据——全程无需 LLM、无需 API Key本地运行、$0/查询。本指南带你快速上手 6 种提取模式并掌握命名 Schema 与自定义 Schema 两种进阶用法。为什么选择 wigolo extract和抓一段 Markdown的 fetch 不同extract 专注于把网页里的结构化信息变成干净的 JSON零 LLM 依赖——所有模式都是确定性解析快且可预测开箱即用——7 种命名 Schema 覆盖文章、食谱、商品、论文等常见页面JSON-LD 原生支持——自动读取页面内嵌的 Schema.org 结构化数据️幻觉防护——自定义 Schema 模式下模型填充的字段会对照原文校验查无实据直接返回null本地优先——结果先查本地缓存命中即返回不重复请求网络核心实现在 src/tools/extract.ts完整参数文档见 docs/tools.md。快速开始一行命令提取表格数据安装 wigolo 后无需任何配置即可提取{ url: https://www.postgresql.org/support/versioning/, mode: tables }在 MCP 客户端如 Claude Code或一次式 CLI 中直接调用即可拿到结构化的headersrows。下面是 CLI 一次式调用的实际效果 小技巧如果提取不到表格页面可能需要 JavaScript 渲染追加execution_mode: stealth让 wigolo 调用真实浏览器重试。6 种提取模式速查表模式提取内容适用场景structured表格 定义列表 JSON-LD 键值对 图表提示默认首选一次性拿全tables仅 HTML 表格含 div 网格布局表格只关心表格数据schema匹配你提供的 JSON Schema 字段只要指定字段named_schema7 种内置形状见下节文章、食谱、商品等标准页面metadata标题、描述、OpenGraph、canonical 等只要页面元信息selectorCSS 选择器命中的内容知道精确选择器structured模式会同时收集页面里的table表格、div/flex 网格卡片没有table标签的定价页也能识别、dl定义列表、JSON-LD 块、图表 aria-label 提示等全部汇总到一个对象中实现逻辑见 src/extraction/structured.ts。JSON-LD 自动解析页面隐藏的数据金矿现代网站尤其电商、媒体、文档站普遍在 HTML 中内嵌application/ldjson脚本块——这正是 Google 用来理解页面内容的 Schema.org 数据。wigolo extract 会自动扫描全部script typeapplication/ldjson块支持数组格式与graph嵌套结构在metadata/structured模式下作为jsonld字段返回在schema模式下优先从 JSON-LD 匹配你的字段名压过 DOM 猜测解析逻辑见 src/extraction/jsonld.ts。对商品页而言价格、库存、评分往往只在 JSON-LD 里extract 会帮你精准取出。命名 Schema7 种开箱即用的数据形状不想手写 Schema直接传named_schemawigolo 会用纯启发式规则完全不需要 LLM提取到严格的数据形状命名 Schema返回字段实现Articletitle、body、author、date、description、language自动剥离维基百科式参考文献、导航框Article.tsRecipename、ingredients、instructions、totalTime、prepTime、cookTimeRecipe.tsProductname、brand、price、sku、rating、imageProduct.tsCodeSnippet代码块、语言标记CodeSnippet.tsPaper论文标题、作者、摘要等Paper.tsEventListing活动名称、时间、地点EventListing.tsJobPosting职位标题、薪资、职责JobPosting.ts{ url: https://blog.example.com/post, named_schema: Article }以Product为例wigolo 先找 JSON-LD 中的type: Product块取不到才降级到 Open Graph 标签保证价格、品牌等字段的可靠性。全部注册入口见 src/extraction/v1/schemas/index.ts。自定义 JSON Schema只提取你需要的字段mode: schema让你用自己的 JSON Schema 定义目标字段wigolo 通过CSS 类名、ARIA 标签、Microdata、JSON-LD四条路径匹配页面内容{ url: https://example.com/pricing, mode: schema, schema: { type: object, properties: { name: { type: string }, price: { type: string }, sku: { type: string } } } }关键设计✅ 字段名直接对撞页面结构无需写选择器✅ 配置了本地模型时模型只负责补全确定性解析漏掉的字段且每个值都会经过证据校验——原文中不存在的值被置为null并写入warnings绝不编造⚠️schema与named_schema互斥同时传会报错⚠️ Schema 必须包含properties键否则被拒绝匹配引擎见 src/extraction/schema.ts。Token 预算控制大表格也不怕max_tokens_outcl100k-base 计数可以封顶输出体积。裁剪策略非常智能先删表格尾行、保留表头再删数组末尾元素超长字符串就地截断——结构始终完整且会标记truncated: true并给出精确的warnings如保留 120/500 行方便你决定是否加大预算重取。tables模式未指定预算时默认 30000 字符上限。最佳实践与避坑清单首选structured——它包含 tables 的全部能力外加定义列表、JSON-LD、图表提示要 Markdown 正文请用fetchextract 只负责结构化数据知道页面类型就用named_schema——比手写 Schema 更严格、更省 token商品/文章类页面优先信任 JSON-LD 路径——准确率远高于 DOM 猜测需要登录/点击后才出现的数据——先用fetch的use_auth或actions处理交互再提取️多页面批量提取——改用 wigolo 的agent工具在 Claude Code 中接入 wigolo 后AI 助手可以自主调用 extract 完成抓取定价表 → 转 JSON → 对比分析这类任务延伸阅读技能说明含反模式清单skills/wigolo-extract/SKILL.md工具总览与全部参数docs/tools.md品牌资产提取logo、配色、字体src/extraction/brand.ts证据校验机制src/extraction/schema-truth.ts【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表