
简介面向希望离线运行大语言模型的开发者、研究人员与普通用户一份PDF教程完整梳理DeepSeek R1本地部署与本地知识库搭建全流程。资源仅含1个PDF文件压缩包约1.46MB体量轻量、方便下载后随时查阅。教程从Ollama开源工具安装讲起逐步演示如何根据电脑RAM选择DeepSeek R1 7B/13B/33B对应版本分别建议8GB/16GB/32GB内存再通过Cherry-Studio图形界面创建API密钥、配置模型并展开对话最终实现本地知识库的新建、文件添加与对话时引用形成一套可独立运行的本地问答系统。文中还给出了不同配置下的选型建议提醒注意内存下限并对本地部署带来的数据隐私保护优势做了说明。目前已有2034人学习适合零基础入门以及需要定制化检索回答的技术爱好者直接对照操作。1. 本地部署 DeepSeek R1不是高配电脑的专利先说一个反直觉的事实跑 DeepSeek R1 并不需要独立显卡一台 8GB 内存的普通电脑用 Ollama 就能启动 7B 版本的本地对话16GB 内存可以上 13B。很多人以为本地跑大模型是高端工作站的事其实真正的门槛是「命令不会敲、界面不会配、文档不知道怎么变成可检索的知识库」。这篇文章按部署顺序拆完四个环节Ollama 安装、DeepSeek R1 模型拉取、Cherry-Studio 可视化接入、本地知识库搭建每一步都给可复制的命令和参数最后一章附 5 个常见翻车点。适合想本地私有化运行大模型、又不愿意把内部文档交给云端服务的开发者和技术爱好者。2. Ollama 安装与模型拉取从零到命令行对话2.1 安装 Ollama下载、验证与环境变量Ollama 是一个专注于简化大语言模型本地部署的开源工具。它把模型权重、推理引擎和 API 服务打包在一起安装完成后会在后台启动一个本地服务默认监听 11434 端口。之后无论是命令行还是 Cherry-Studio本质上都是跟这个服务在通信。从官网 https://ollama.com/ 下载 Windows 安装包文件名一般是 OllamaSetup.exe。双击后按默认设置一路 Next 就行安装目录建议保持默认因为安装器会自动配置 PATH 和后台服务。这里有个细节安装完成后必须打开一个新的命令行窗口旧的窗口不会加载刚写入的环境变量直接执行ollama会提示找不到命令。# 验证 Ollama 是否安装成功 ollama --version输出类似Ollama version is 0.x.x即表示安装成功。如果提示找不到命令重启命令行或注销重新登录一次让环境变量生效。验证逻辑说明ollama --version是在确认主程序是否被加入系统 PATH同时检查运行库是否完整。安装器默认把 Ollama 装到%LOCALAPPDATA%\Programs\Ollama这一步通过后ollama命令就能在任意目录下使用。接下来建议顺手处理模型存储路径。默认情况下所有模型文件存放在C:\Users\用户名\.ollama\models随着拉取的模型增多C 盘会被占掉几十 GB。我一般会在安装后立刻设置环境变量# Windows 下把模型存储目录改到 D 盘 setx OLLAMA_MODELS D:\ollama_modelssetx是 Windows 自带的命令用于写入用户级环境变量。注意设置后需要重启命令行和 Ollama 服务才生效。这里有个很容易踩的坑很多人改完直接执行ollama pull发现模型还是下载到 C 盘就是因为后台服务还在用旧的环境变量重启 Ollama 服务或重启电脑才能解决。2.2 按内存选模型7B / 13B / 33B 的边界判断DeepSeek R1 在 Ollama 上有多个版本模型列表在 https://ollama.com/library/deepseek-r1。选哪个版本核心就一个指标你的内存多大。模型版本最低 RAM适用场景deepseek-r1:7b8GB日常问答、Prompt 测试、教学演示deepseek-r1:13b16GB回答质量更高适合技术研究deepseek-r1:33b32GB输出更完整但对内存要求苛刻这里要说明一个常见误解内存参考值不是「模型文件大小」而是「运行时内存占用」。7B 模型按 Q4 量化权重文件大约 4.7GB单次推理时还要为 KV cache 分配额外内存通常是权重的 30% 到 50%。所以 8GB 内存跑 7B已经是贴着下限了。如果配置不确定我的建议是16GB 内存直接上 13B回答质量的提升是能明显感知的8GB 内存老老实实跑 7B32GB 可以尝试 33B但不要同时开一堆浏览器标签页。还有一个很容易忽视的点本地推理的大瓶颈是内存容量不是 CPU 核心数也不是有没有显卡。内存不够模型根本加载不进来。2.3 拉取模型与对话测试核心命令详解在 DeepSeek R1 的模型页面选择版本复制对应的拉取命令。比如拉取 7B# 拉取 7B 模型这也是大多数人入门的选择 ollama pull deepseek-r1:7b执行后能看到下载进度条和网速信息。拉取完成后出现 success 提示。这里解释一下pull和run的区别pull只下载不启动run如果本地没有该模型会自动触发下载再进入对话两者效果一样。但想确认模型完整拉下来了用pull更明确。对话测试# 进入交互式对话 ollama run deepseek-r1:7b出现对话提示符后输入「你好」测试返回。退出对话按CtrlD或者在对话里输入/bye。日常维护最常用的几个命令# 查看本机已安装的模型 ollama list # 查看模型详情上下文长度、量化等级、参数大小 ollama show deepseek-r1:7b # 删除模型释放磁盘空间 ollama rm deepseek-r1:7b这三个命令各自的价值ollama list能确认模型是否真的拉取成功ollama show能看到模型的 context length 和 quantization 信息配置 Cherry-Studio 和知识库时要用ollama rm用于清理不用的模型避免磁盘被占满。最后验证 API 服务这是 Cherry-Studio 接入的基础# 查看 Ollama 的 API 服务是否正常监听 curl http://localhost:11434/api/tags返回类似{models: [...]}的 JSON 即表示服务正常。如果返回空或连接拒绝说明 Ollama 服务没启动去任务管理器确认 Ollama 后台进程或在命令行执行ollama serve手动拉起服务。3. Cherry-Studio 接入把命令行升级成可视化桌面应用3.1 安装 Cherry-Studio 与理解两种接入方式命令行对话能用但长期用确实不方便。Cherry-Studio 就是来解决这个问题的它是一个桌面客户端安装包是 Cherry-Studio-0.9.19-setup.exe双击安装后运行。开始配置之前必须先讲清楚一个概念否则后面容易绕晕Cherry-Studio 不是一个模型运行器它是模型的「前端界面」。它支持两种方式连接 DeepSeek通过 Ollama 连接本机部署的 DeepSeek R1数据不出本机断网也能用通过 SiliconFlow 等平台的 API Key 连接云端模型需要注册账号教程里提到在 https://siliconflow.cn/zh-cn/ 注册账号那一分支走的是云端 API。而标题强调的「本地部署」走的是 Ollama 分支两者在 Cherry-Studio 里的配置入口不一样别搞混。如果你追求纯本地只配置 Ollama 就够了完全不需要注册任何平台账号。3.2 配置 Ollama 本地服务接入:需要避开的地址陷阱打开 Cherry-Studio进入设置界面找到模型服务商配置。选择 Ollama 后需要填两个关键内容服务地址http://localhost:11434 模型名称deepseek-r1:7b配置要点有三条。第一服务地址不能写成http://localhost:11434/v1Ollama 的 API 根路径不带/v1多写这一截会直接 404。第二模型名称必须和ollama list输出的名称完全一致包括冒号和版本号这个细节最容易翻车。第三配置完成后 Cherry-Studio 会自动拉取模型列表如果看到deepseek-r1:7b出现在下拉框里说明连接成功。配置好后就可以在对话窗口选择模型直接开聊。此时所有请求都发往本地 11434 端口把网线拔掉都能回复这才叫真正的本地部署。3.3 配置 SiliconFlow 云端 API不追求纯本地的备选方案如果你希望保留一条云端推理的路径可以走 SiliconFlow。流程是注册账号在控制台创建一个 API Key然后在 Cherry-Studio 的模型服务商里选择 SiliconFlow填入 Key选择deepseek-ai/DeepSeek-R1模型。创建 API Key 时注意Key 只完整显示一次一定要先复制保存好丢了就重新生成。Cherry-Studio 的密钥管理栏不要有多余空格。如果你已经配置了本地 Ollama再配置一个云端 API 作为补充在模型选择下拉框里切换即可不影响本地链路。3.4 对话参数温度、Top-P 与上下文长度Cherry-Studio 的对话参数直接影响输出质量这几个参数值得细调参数默认值作用Temperature0.7越低回答越确定越高越有随机性代码类任务建议调到 0.2Top-P0.9控制候选词的累积概率配合 Temperature 使用Context Length视模型而定对话历史长度上限超出后旧内容被截断Max Tokens视模型而定单次回复的最长 token 数在本地推理场景里Context Length 是最值得关注的参数。Ollama 默认情况下 7B 模型上下文在 2048 到 4096 tokens 之间对话轮数一多早期内容就会被挤掉。把上下文拉长会明显增加内存占用所以笔记本内存不高时不要盲目拉满。我一般保持默认遇到多轮对话需求时才手动调大。配置完成后多轮对话测试确认 Cherry-Studio 调用了本地模型。验证方法很直接断网试一句能回复就说明走的是本地链路。4. 避坑指南本地部署 DeepSeek R1 的 5 个常见翻车点4.1 模型下载到一半停了重试还是失败现象ollama pull长期卡在某个进度或者中途报HTTP error、EOF之类的错误。原因模型文件动辄几个 GB网络环境不稳定时很容易中断这个是常态不是个例。解决Ollama 支持断点续传再次执行同一条ollama pull命令会从断点继续下载不需要删掉重下。如果反复在同一个进度失败换个相对空闲的时间段再试或者先拉一个小模型验证网络通路。不要反复执行rm重新拉取那会前功尽弃。4.2 对话时电脑卡死输出慢得离谱现象输入问题后长时间无响应任务管理器显示内存几乎占满风扇狂转。原因模型版本超出内存实际可用量系统开始疯狂使用虚拟内存交换整个电脑被拖垮。解决用ollama rm删掉超出配置的模型换低一档版本。比如 16GB 内存跑 33B 卡死删掉换 13B 即可。同时关掉浏览器等大内存应用在 Cherry-Studio 里调小 Context Length。这个坑我踩过不止一次血泪经验是部署前先看一眼任务管理器的空闲内存别只看总内存。4.3 Cherry-Studio 显示连接失败现象配置完 Ollama 后对话时报Cannot connect或send request failed。原因Ollama 后台服务没运行或者服务地址写错最常见的是多写了/v1路径再者是模型名称与本地不一致。解决按顺序排查。先执行curl http://localhost:11434/api/tags确认服务在监听再核对设置里的地址是否为http://localhost:11434不带任何后缀最后检查模型名称是否和ollama list输出的一模一样。这三步能解决九成以上的连接问题。4.4 选了知识库但回答没引用文档内容现象建了知识库、加了文件对话时也选中了知识库但回答一看就是模型的通用能力完全没用到文档。原因有两种可能。一是文件解析失败内容根本没有进入知识库二是检索到的内容没能拼进 prompt模型压根不知道有这些材料。解决先去知识库里检查文件状态看解析是否成功。如果文件带红叉把文档转成纯文本再导入。如果解析没问题删掉知识库重建一次Cherry-Studio 的索引偶尔会有缓存问题。这个方法能解决绝大多数「知识库无效」的翻车。4.5 SiliconFlow 密钥报 401现象配置云端 API 后对话时返回401 Unauthorized。原因API Key 复制不全漏了字符或者密钥创建时间太短还没生效。解决回到 SiliconFlow 控制台重新生成一个 Key用平台的复制按钮完整复制粘贴时注意确认没有多余空格。别手抖只复制前半截这个错误很低级但确实容易犯。5. 搭建本地知识库把文档变成可检索的私域数据5.1 知识库原理RAG 如何让模型「读」你的文档本地知识库的核心机制是 RAG也就是检索增强生成。通俗讲模型本身不知道你文档里写了什么知识库的作用是「先检索再回答」。整个流程分三步把文档切分成块每块几百到上千 tokens把块向量化转成高维向量并建立索引用户提问时计算问题向量与每个块向量的相似度取出最相近的几块拼进 prompt 再交给大模型理解这个流程对排查问题非常有用。回答不引用文档时要么是向量检索没有取回相关内容要么是拼接进去的内容被模型忽略了。Cherry-Studio 把整套流程封装在界面里用户只需要建库、加文件、选库对话但底层逻辑是相通的。嵌入模型这一环Cherry-Studio 会调用本地推理服务的 embedding 接口不需要额外安装。5.2 新建知识库与添加文件格式与分块参数在 Cherry-Studio 左侧找到知识库入口新建一个库输入名称和存储位置。然后添加文件支持的格式通常包括 txt、md、pdf、docx。添加文件时的注意点单文件不要太大几十页以内的文档最适合大文件可以先拆分再导入PDF 如果是扫描图片需要先做 OCR否则解析结果是空的表格类文档解析容易乱建议转成 markdown 或纯文本再导入知识库的分块参数默认值就能用但了解含义有助于调优参数默认值建议Chunk Size500 tokens做技术手册问答可调到 800Chunk Overlap50 tokens保留上下文衔接不宜设置为 0文档主题偏技术、内容密集分块大一点检索时上下文更完整做碎片化问答分块小一点召回更精准。添加文件后稍等片刻检查解析状态全部解析成功再开始对话。5.3 对话时选择知识库验证检索是否生效在对话窗口里选择已经建好的知识库然后提问。怎么验证检索真的生效了我的做法是问一个「文档里写得很明确、但通用模型不太可能知道」的内容比如公司内部的术语、特定项目的编号、或者某个文档里出现过的具体数字。如果回答能准确引用这些细节说明检索链路是通的。如果回答完全不相关优先怀疑文件解析失败。把文档转成纯文本重新导入即可。还有一种情况文档内容太少检索进来后对模型的判断影响不够模型倾向于用自己的知识回答。这时需要调整 Prompt明确要求「只依据知识库内容回答」效果会好很多。5.4 知识库的维护更新与清理知识库不是一次性工作。文档更新后旧版本的内容还留在向量索引里检索时可能返回过期信息。我一般这样维护每次文档变更后在知识库里删除旧文件重新上传新版本再确认解析状态。对话前也习惯先看一眼知识库文件列表确认解析完成再提问。长期不用的知识库建议直接删除减少磁盘占用。索引文件虽然不大但积少成多清理一下更清爽。6. 部署后的进阶验证量化选择与性能观察先验证本地生成速度再决定要不要调模型。这里用一个实用的方法通过 API 接口测出每秒生成多少 token# 用 time 观察整体耗时返回数据里有生成速度 time curl http://localhost:11434/api/generate -d { model: deepseek-r1:7b, prompt: 你好用一句话介绍你自己, stream: false }返回的 JSON 里有两个关键字段eval_count是生成的 token 总数eval_duration是生成耗时纳秒)。两者相除就能算出每秒生成速度。以 7B Q4 量化版本为例8GB 内存的 CPU 机器速度大概在 5 到 15 token/s 之间低于 3 token/s 就说明内存带宽吃紧或者上下文调得太长了。量化的选择也值得花一分钟做。用ollama show deepseek-r1:7b能看到当前模型的量化等级一般有三种量化等级质量内存占用适用场景Q2_K有可见损失最低极限低配机器Q4_K_M平衡适中大多数人的选择Q8_0接近原始精度较高内存充裕追求质量不同量化版本在对话质量上的差异是能感受到的但没那么夸张。我建议内存紧张就用 Q4_K_M别上 Q2_K省的那点内存换来的回答质量下降不值得。验证完速度再对比一下 7B 和 13B 在同一个问题上的回答差异能直观感受模型规模对输出的影响。这不算严谨评测但能帮你确认当前配置下升级内存换更大模型是否值得。我最早部署时仗着 16GB 内存直接拉 33B结果整台电脑卡了十分钟最后只能强制重启数据都没保存那是相当狼狈。从那以后我每次部署都先看任务管理器的空闲内存再选模型宁可选小一档也不要让机器在交换内存里挣扎。先跑通小模型再考虑升级这个顺序最省时间。希望帮到你。本文还有配套的精品资源点击获取