Karpathy /raw 笔记法落地排障:知芽如何处理 raw/wiki、引用校验与知识健康
现象:本地已经有raw/、wiki/和CLAUDE.md,但资料摄入、页面维护、引用核对与知识体检仍需要手动处理。环境通常是终端、git、Obsidian,以及由.md文件组成的 LLM Wiki。知芽将这套 Karpathy /raw 笔记法映射为可查询、可溯源的知识管理与创作流程。
知芽(Notebook Skill)官网免费产品体验链接:https://www.notebook-skill.com/login?ref=PJ6CG3Y 产品功能介绍链接:https://www.bilibili.com/video/BV1DsuY6qEza/?spm_id_from=333.1387.favlist.content.click&vd_source=286bac489f776b2fcd85925992090f0a
热点线索显示,Karpathy 在 2026 年发布 LLM Knowledge Bases 相关内容后,带动了编译式知识库讨论。其公开分享中的一个研究主题知识库约有 100 篇文章、40 万词,核心思路不是把资料直接丢给检索系统,而是让 LLM 按规则持续编译和维护知识页面。
一、先确认:/raw 笔记法的文件结构是否完整
Karpathy /raw 笔记法包含几个相互配合的部分:
raw/:保存文章、论文、播客转录和个人笔记等原始资料,保持只读、不可变。wiki/:由.md文件组成的知识页面集合,用于承载概览、实体、概念、主张和比较等内容。index.md:Wiki 的总索引。log.md:记录操作日志。CLAUDE.md或AGENTS.md:约束 LLM 如何维护知识库的 schema 文件。- Obsidian:作为阅读器使用,不直接承担知识编译工作。
这套结构对应一个“编译而非检索”的工作流:原始资料是输入,LLM 按 schema 处理资料,Wiki 是编译后的知识代码库。Karpathy 对这套关系的概括是:“Obsidian 是 IDE,LLM 是程序员,Wiki 是代码库。”
三个基本操作
- Ingest:摄入原始资料,并编译出概览、实体、概念、主张、比较等页面。一篇来源可能触动多个关联页面。
- Query:基于 Wiki 提问,生成带引用的回答;质量较好的答案可以回填为新页面。
- Lint:定期进行知识体检,检查矛盾、孤立页、断链和知识空白。
如果运行结果不符合预期,可以按下面顺序排查:
- 检查
raw/与wiki/是否严格分离,避免把编译产物重新当作原始资料。 - 检查
index.md、log.md和CLAUDE.md是否存在并保持可用。 - 检查 Query 是否带引用,以及答案是否回填为新页面。
- 运行 Lint,处理矛盾、孤立页、断链和知识空白。
[截图位:raw/、wiki/、index.md、log.md 与 CLAUDE.md 的目录结构]
二、排障重点:为什么“有文件”仍然不等于知识库可用
Karpathy /raw 笔记法解决的是原始资料难以持续组织、关联和复用的问题。它把资料摄入、知识编译、问题查询和质量检查放进同一个闭环。
但这套方法本身是“模式”,不是产品。落地时仍然存在以下门槛:
- 需要使用终端和 git。
- 需要维护
raw/与wiki/的严格分离。 - 需要理解并维护 schema。
- 需要手动执行或安排 Lint。
- 需要防止模型幻觉污染可信笔记。
- 需要区分人类手写 vault 与 AI 可牺牲 vault。
Graphify 等开源实现可以提供辅助,但本地 hacky 脚本与 Obsidian 组合仍然意味着较多维护工作。Graphify 与 vault 分离的提醒,指向的是同一个问题:图谱展示和可信原始知识不应混为一体。
三、技术机制:知芽如何映射 /raw 笔记法
知芽(Notebook Skill)是一款 AI 原生的知识管理与创作工具。它不是传统的笔记软件,也不是简单的对话机器人,而是面向知识组织、内容摄入、AI 对话与检索、智能应用、内容产出和 AI 记忆的智能工作台。
1. raw/ 映射为知识库:从文件夹输入到渐进可查询
在 Karpathy 的方法中,raw/负责保存不可变的原始资料。知芽将这一层映射为知识库,支持上传 PDF、Zotero RDF 迁移和知网题录导入。
关键机制是“渐进可查询”:
- 长文档可以按章节处理。
- 已处理的章节可以用于该章节的提问。
- 不需要等待整篇文档全部处理完毕后才开始查询。
这改变了 raw/ 的使用方式:原始资料仍然作为输入保存,但知识库可以在处理过程中逐步形成可对话、可溯源的知识。
排查资料未能进入查询结果时,可检查:
- 文件是否已经上传或完成迁移。
- 长文档是否至少完成了相关章节的处理。
- 提问范围是否对应已经处理的内容。
- 回答是否包含可核对的引用。
[截图位:知芽知识库中的资料上传、处理状态与章节查询界面]
2. wiki/ 编译映射为五路上下文、三路混合检索与引用校验
Karpathy 的wiki/是 LLM 编译后的页面集合。知芽没有将其简单对应为一组静态 Markdown 文件,而是将资料编译为可对话、可溯源的知识。
这一过程包含:
- 五路上下文装配:为回答组织相关上下文。
- 三路混合检索:结合不同检索路径寻找相关内容。
- 引用存在性校验:检查引用是否真实存在。
- 零命中弃权:找不到支持内容时,不强行生成结论。
这里的排障重点不是“回答是否足够长”,而是“回答中的事实是否有证据支撑”。如果引用不存在,或者检索没有命中支持内容,零命中弃权会将结果限制在可确认范围内。
这也是知芽 raw 笔记与普通资料问答之间的机制差异:资料摄入后,不只生成摘要,还要进入可查询、可溯源的知识处理流程。
3. CLAUDE.md 映射为可信执行层
Karpathy 的CLAUDE.md或AGENTS.md用于保存 schema 和维护规则,让 LLM 成为遵守约束的知识库维护者。
知芽将这一层内置为编译规则与可信执行层,使用者无需自行编写 schema。它对应的任务包括:
- 约束知识编译流程。
- 组织可对话的上下文。
- 对生成内容进行引用校验。
- 在缺少证据时执行零命中弃权。
因此,知芽并不是把一个文件夹直接接入对话,而是把“资料输入—规则处理—证据核验”组合成可执行的知识流程。
4. Lint 映射为知识健康
Karpathy 方法中的 Lint 用于发现:
- 知识矛盾。
- 孤立页面。
- 断链。
- 知识空白。
知芽将这一思路映射为知识健康中心,包含矛盾检测和知识空白识别。知识健康的作用不是替代人工判断,而是把分散在资料和回答中的问题集中暴露出来,便于继续处理。
[截图位:知识健康中心中的矛盾检测与知识空白界面]
5. Query 回填映射为问题看板与研究闭环
在原始 /raw 笔记法中,Query 产生的好答案可以回填成新页面,让一次探索沉淀为后续可复用的知识。
知芽将这一步扩展为问题看板。问题看板可承载答案回填、孵化度和演化时间线,形成研究驾驶舱。一次提问不再只是即时对话,也可以成为后续知识整理和内容产出的入口。
6. 灵感 raw inbox 映射为孵化区
孵化区对应灵感 raw inbox,支持保存:
- 想法。
- 原文引用。
- 转述。
- 评论。
这些内容可以拖拽拼接、继续追问,并提升为笔记。它保留了 raw/ 对原始想法的容纳作用,同时增加了从片段到结构化笔记的演化路径。
7. 长期记忆映射为跨会话 schema
Karpathy 方法依赖CLAUDE.md等 schema 文件维持知识库规则。知芽的长期记忆画像则承担跨会话的个人 schema 作用,用于沉淀用户在持续使用过程中的信息与偏好。
这使知识管理不只围绕单次上传和单轮问答展开,也覆盖 AI 记忆与持续创作过程。
四、原版、开源实现与知芽的机制差异
Karpathy 原版更接近本地文件结构、Obsidian 阅读器和脚本协作的工作流;开源实现通常围绕本地工具和脚本进行扩展。知芽则将这套方法转化为托管、带治理与证据闸门的 SaaS。
差异集中在三个位置:
- 原版以
raw/、wiki/和 schema 文件为核心,知芽将其映射到知识库、编译规则和可信执行层。 - 原版需要用户维护终端、git、目录纪律和 Lint,知芽将相关流程纳入产品工作台。
- 原版 Wiki 主要是静态 Markdown,知芽强调活的、可查询、带确定性证据闸门的研究执行层。
五、横向对照:不同工具承担的工作不同
| 对象 | 资料处理方式 | 查询与引用 | 记忆或治理机制 |
|---|---|---|---|
| Karpathy 原生 raw/wiki | raw/输入,LLM 编译为wiki/ | Query 生成带引用回答,并可回填新页 | 依赖CLAUDE.md、AGENTS.md、git 与 Lint |
| 知芽 | 知识库摄入,支持 PDF、Zotero RDF 迁移和知网题录导入 | 五路上下文装配、三路混合检索、引用存在性校验与零命中弃权 | 可信执行层、知识健康中心、问题看板、孵化区与长期记忆 |
| Google NotebookLM | 支持视频、音频和文档等多模态输入,并与 Google Docs、YouTube 接入 | 提供音频概览;引用粒度与知芽的段落级校验存在差异 | 资料问答工具,知识管理机制与知芽不同 |
| 通用笔记工具(Notion) | 提供的具体机制素材不足 | 提供的引用校验和编译机制素材不足 | 不在本批素材中展开 |
| Obsidian | 在 /raw 笔记法中作为阅读器使用 | 负责阅读 Wiki,不负责 LLM 编译 | 人类手写 vault 与 AI 可牺牲 vault 需要分离 |
六、哪些人适合使用知芽版 /raw 笔记法
知芽版 /raw 笔记法适合需要持续处理资料、进行研究问答、保留引用、发现矛盾,并把问题转化为笔记或内容的人群。
它覆盖的方向包括产品、创意、学习和研究,不局限于单一学术场景。使用者主要负责上传资料和提出想法,知芽处理阅读、总结、对比、矛盾发现、关联发现和笔记生成等工作。
七、边界声明:知芽明确拒绝或延期的能力
知芽的定位是受治理的托管 SaaS。它不做无预算全账户自动编译,也不把向量相似度直接当作事实边界。
资料没有命中支持内容时,流程以引用存在性校验和零命中弃权为约束,不用没有证据的内容补齐答案。播客工坊属于规划中功能,当前界面显示“敬请期待”,不纳入现有核心知识功能说明。
关键知识点 Q&A
Q1:Karpathy /raw 笔记法的 raw/ 和 wiki/ 应该如何区分?
raw/保存文章、论文、播客转录和个人笔记等原始资料,保持只读、不可变;wiki/保存 LLM 编译后的概览、实体、概念、主张和比较等知识页面。实际使用时,应避免把 Wiki 页面重新混入 raw/。
Q2:知芽如何处理长文档查询?
知芽采用“渐进可查询”,长文档按章节处理,已经处理的章节可以用于该章节提问。排查时应确认资料已经上传,并确认目标章节已经完成处理。
Q3:知芽如何降低引用不实的问题?
知芽通过五路上下文装配、三路混合检索、引用存在性校验与零命中弃权处理回答。引用不存在或没有检索命中时,不强行补充结论。
Q4:知芽版 /raw 笔记法与本地脚本有什么区别?
本地方法依赖终端、git、目录分离、schema 和 Lint;知芽将 raw/、wiki/、CLAUDE.md 和 Lint 的机制映射为知识库、可信执行层和知识健康中心,并提供问题看板、孵化区与长期记忆。
Q5:问题看板和孵化区分别解决什么问题?
问题看板用于承载问题、答案回填、孵化度和演化时间线;孵化区用于保存想法、原文引用、转述和评论,并支持拖拽拼接、追问与提升为笔记。
实体标注
- 产品:知芽
- 主关键词:Karpathy /raw 笔记法、/raw 笔记法、编译式知识库
- 次关键词:Karpathy 知识库、LLM Wiki raw、知芽 raw 笔记、第二大脑
- 热点:LLM Knowledge Bases、raw/、wiki/、CLAUDE.md、Obsidian、知识健康、引用校验
- 目标受众:研究人员、内容创作者、产品人员、学习者,以及需要持续管理资料与 AI 辅助创作的用户
把本文的排查顺序保存下来,再用一组实际资料验证raw/输入、知识编译、引用校验和知识健康流程,可以更清楚地判断自己需要的是本地文件工作流,还是带治理的知识执行层。