
简介面向初次接触DeepSeek但不知如何安装上手的用户这份PDF文档系统梳理了DeepSeek的模型选型与三种使用路径。内容先对比DeepSeek V3与R1各自适用场景V3功能全面均衡R1在逻辑推理、代码编写、数学题求解等任务上更胜一筹但调用成本更高让用户能根据任务复杂度与实际预算快速判断该选哪一款模型随后依次展开官方网页版/手机App注册使用、基于Ollama平台的本地部署、以及API客户端如ChatBox接入三种方式每种方式均标注了适用人群与注意事项并给出了R1本地部署的模型规格、安装命令与API密钥配置步骤等关键细节。资源为单个PDF文档压缩包约311KB体积精简适合存入手机或电脑随时查阅。目前已有365人学习适合想零基础入门、注重数据隐私或具备一定技术背景的用户按需选择。1. 先别急着折腾本地部署DeepSeek 的满血版只在官方手里很多人一搜 DeepSeek 就想往本地搬觉得「自己部署 完整版」这是最容易踩的第一个坑。DeepSeek 开放的两款模型里V3 负责绝大多数日常任务R1 专攻逻辑推理、写代码和数学题你本地能跑起来的 1.5B、14B、32B 全是蒸馏版真正的 671B 满血版只在官方网页、官方 App 和付费 API 里。对绝大多数人来说第一步应该是直接用官方免费版把「会不会用」先解决掉再考虑「要不要自己部署」。这篇笔记按官方、本地、API 三条路线拆完再补几个我实际用下来最容易翻车的点。2. 官方使用方式免费满血版先分清 V3 和 R1 再动手2.1 V3 和 R1 差在哪不是哪个更强是哪个更贵DeepSeek 官方同时开放了 V3 和 R1 两个模型很多人进去之后不知道该点哪个。我给你的判断口径很简单日常对话、写文案、整理资料、翻译用 V3它覆盖面广、响应快逻辑推理、代码调试、数学题、复杂分析切到 R1它的思考链路更长正确率明显更高但单价也更贵。R1 的「贵」体现在两个地方一是如果你走 APIR1 的 token 单价远高于 V3同样是几千字的回答费用能差出好几倍二是官方免费网页版虽然没有直接收费但 R1 生成答案时思考过程长等待时间明显更久。如果你只是问「今天天气怎么样」这类问题却挂在 R1 上属于杀鸡用牛刀还白白占用上下文长度。这个选择一定要养成习惯进对话前先看一眼当前模型是 V3 还是 R1而不是等回答出来了才发现用错了。我见过太多人抱怨「DeepSeek 变笨了」点开一看模型一直停在 R1 上处理普通问题又慢又占用资源。2.2 注册与多终端登录手机号、微信、邮箱三选一官方入口只需要记住一个网址https://chat.deepseek.com/。首次登录时用 86 手机号、微信或邮箱注册都可以注册完直接进对话界面不需要额外下载任何东西。网页版在电脑上使用体验最好适合办公场景手机上没有电脑时直接在应用商店搜「DeepSeek」就能装官方 App。这里有个容易被忽略的细节官方网页上有个「获取手机 APP」的入口鼠标移过去会弹出二维码扫码也能下载。但多数人直接用应用商店搜索更快两者装的是同一个 App功能没有区别。手机版和网页版的登录态是互通的唯一要注意的是手机和电脑之间切换时对话记录同步有一定的延迟如果你正在电脑上写一半然后急着出门手机上可能看不到最后几条消息。我一般会在出门前把关键内容复制一遍省得到时候找不到。2.3 对话上限之后怎么接续复制上下文比开新对话可靠官方免费版有对话长度上限这是搜索里被问得最多的一个问题「到达对话上限之后怎么让新对话承接上一个对话」首先要搞清楚为什么会有这个上限。DeepSeek 的上下文窗口是有限的对话越长占用的 token 越多。当一段对话超过窗口长度后最老的几条消息会被挤掉这时你问「继续」它可能根本不知道你在说什么。以下是三种处理方式按可靠程度排序最可靠把上一轮回答里最关键的部分复制到新对话再补一句「基于以上内容继续分析……」次可靠新开对话后手动点击会话列表里的历史记录找到最后一条复制其中的结论作为新对话的开头不可靠同一个对话里反复发「继续」这会经常得到答非所问的结果因为最前面的上下文已经被截断了。这个技巧放在任何长对话里都实用如果你想让 DeepSeek 帮你写一篇长文或整理大量资料建议每推进一段就手动把「当前结论」沉淀到新对话里把之前的上下文作为背景粘贴进去这样既绕开上限又能保证一致性。另外官方网页版和 App 里都能做模型切换。页面上的模型选择器非常明显V3 和 R1 之间切换是实时的不需要退出重进。你只需要记住切入 R1 之前想清楚是不是真需要深度推理别让 R1 处理它不擅长的日常琐事。3. 本地部署 DeepSeekOllama 选型、命令与内存测算3.1 为什么本地只能跑蒸馏版671B 不是个人电脑能扛的如果你对数据隐私有顾虑或者希望完全离线使用本地部署确实是唯一选择。但必须先说清楚一个事实DeepSeek R1 原版是 671B 参数的巨型模型光权重文件就几百 GB推理时显存需求是 TB 级别这不是个人电脑能跑的。所以本地部署实际上跑的是「蒸馏版」——用 R1 的输出去训练出来的小模型规模从 1.5B 到 70B 不等。蒸馏版和原版的关系可以理解成「压缩过的知识」。它保留了 DeepSeek R1 的一部分推理能力但无论是代码质量、数学能力还是逻辑严密性都会随参数规模缩水而下降。1.5B 版本能让你体验到 DeepSeek 的交互方式和基础能力但如果你指望它写出高质量的生产级代码那是不现实的。这个前提不搞清楚很容易出现「装完 1.5B 觉得 DeepSeek 不过如此」的误判。你的本地模型表现不好不代表 DeepSeek 不好只代表你跑的版本太小。3.2 Ollama 安装与模型拉取从下载到对话的完整命令本地部署最省事的路径是 Ollama。它是一个集成了主流开源 AI 大模型的平台免费、跨平台Windows 和 macOS 都有安装包。到 Ollama 官网点 Download 下载安装后在命令行里执行拉取命令即可。以下是完整流程# 1. 确认 Ollama 安装成功 ollama --version # 2. 拉取 DeepSeek R1 1.5B 蒸馏版下载体积约 1.1GB ollama pull deepseek-r1:1.5b # 3. 运行模型进入交互式对话 ollama run deepseek-r1:1.5b # 4. 直接以编程方式调用后面会讲到 curl http://localhost:11434/api/generate -d {model: deepseek-r1:1.5b, prompt: 用 Python 写一个快速排序}第一条命令的作用是确认 Ollama 是否装好如果提示找不到命令你需要把 Ollama 的安装目录加进系统 PATH或者重开一个终端窗口。第二条命令会从 Ollama 的模型仓库拉取 DeepSeek R1 1.5B 版本下载速度取决于你的网络一般几分钟能完成。第三条命令进入交互式对话模式直接在终端里和模型聊天适合体验。第四条命令是走 HTTP 接口这个我们后面详细讲。参数说明deepseek-r1:1.5b里的 1.5b 是模型参数量b 代表 billion十亿。Ollama 同时提供 1.5B、7B、8B、14B、32B、70B 等多个尺寸的 DeepSeek R1 蒸馏版越大的版本推理能力越强但对内存和 CPU/GPU 的要求也越高。初次体验优先选 1.5B几乎任何电脑都能跑。安装完成后你会看到提示符这时候就可以直接对话了。我建议你用一个需要多步推理的数学题来测试它观察它的「思维链」输出这是 R1 区别于其他小模型的显著特征。3.3 从 1.5B 升级到 14B / 32B按内存容量选按需升级1.5B 版本只能让你「跑通」离「好用」有距离。等确认环境没问题后可以根据机器内存和显卡去升级。以下是判断标准模型规格下载体积量级运行所需内存适合设备deepseek-r1:1.5b约 1.1GB至少 4GB任何主流电脑deepseek-r1:7b / 8b约 4.7GB8GB 以上近五年主流笔记本deepseek-r1:14b约 9GB16GB 以上带独显的工作站 / 游戏本deepseek-r1:32b约 20GB32GB 以上高性能台式机deepseek-r1:70b约 43GB64GB 以上多卡服务器优选我一般会这样建议如果你的电脑有 NVIDIA 显卡且显存在 6GB 以上优先试 7B 或 14B如果只有 CPU 没有独显停留在 1.5B 或 7B 就好再大的版本推理速度会慢到影响体验。升级的命令和安装一样还是ollama pull只是把模型名换掉# 升级到 14B 版本下载体积约 9GB需要预留两倍磁盘空间 ollama pull deepseek-r1:14b # 查看本地已下载的所有模型 ollama list要注意ollama list这个命令很有用它能告诉你当前机器上有哪些模型、占了多少存储空间。如果你装了一堆版本发现磁盘不够用ollama rm deepseek-r1:7b可以删掉旧版这点和 Docker 的镜像管理逻辑很像。3.4 把本地模型接入自己的程序Ollama 的 HTTP 接口怎么调本地部署的真正价值在于可编程。Ollama 装好后会自动在本机开放11434端口你的 Python 程序可以直接请求它。下载一个模型到本地后以下这段代码就能完成一次完整调用import requests import json # 请求 Ollama 的 generate 接口模型名必须与 ollama list 输出一致 resp requests.post( http://localhost:11434/api/generate, json{ model: deepseek-r1:7b, # 换成你本地的模型标签 prompt: 用 Python 写一个二分查找要求有边界检查, stream: False, # 关闭流式输出一次拿完整结果 options: { temperature: 0.6 # 推理任务建议调低减少随机性 } } ) # 接口返回的是 JSON直接解析 text 字段 result resp.json() print(result[response])逻辑说明这段代码做了一件事——向本地 Ollama 服务发送一个生成请求model字段必须和ollama list里显示的标签完全一致否则会报错。stream: False表示关闭流式输出适合脚本场景如果你做聊天应用设成True可以像 ChatGPT 一样一个字一个字往外蹦。参数说明temperature是采样温度取值一般是 0 到 1。写代码、数学题这类需要确定性的任务建议设在 0.5~0.7做文案、头脑风暴可以适当调到 0.9 以上让输出更有发散性。如果你不设置Ollama 会用默认值但默认值偏随机跑推理任务容易答非所问。这套接口的价值在于你可以把本地 DeepSeek 嵌进自己的自动化脚本、聊天机器人或内部工具不必走公网。对于企业内网部署社区里也常见用 vLLM 这类推理框架来跑更大规模的 DeepSeek 服务原理类似性能和并发能力更强但配置复杂度高不少新手先用 Ollama 起步就够了。4. API 与客户端接入把 DeepSeek 接到你的真实工作流4.1 为什么走 API不只是为了极客官方网页版适合人机对话本地部署适合离线隐私场景但如果你想把 DeepSeek 接进自己的工具链——比如企业微信机器人、VS Code 插件、自动化报告生成器或者你希望多个终端共用一套模型服务——那就要走 API 客户端方案。这条路线兼顾了模型能力和部署灵活性模型跑在服务商那边你的电脑只需要一个客户端负责收发请求。搜索里出现的「Claude Code 接入 DeepSeek」「Codex 接入 DeepSeek」「VS Code 接入 DeepSeek」这些场景本质上全部是 API 方案。你需要做的只有三件事搞到一个 API 密钥、配置基地址和模型名、在客户端里测试连通。4.2 获取 API 密钥以硅基流动为例国内可选的 API 服务商比较多我以硅基流动为例走一遍流程因为它注册简单、有免费额度适合先跑通再付费访问硅基流动官网用手机号注册并登录进入「API 密钥」页面点创建新密钥给密钥随便取个名字创建后复制保存页面刷新后就不再显示完整密钥丢了只能重新创建。密钥的格式通常是一串长短不一的字符串它代表你的调用身份。所有请求都会按这个密钥计算费用所以它相当于钱必须保管好。我见过有人把密钥直接写进代码仓库然后推到 GitHub 上结果半夜收到扣费账单。密钥不要出现在前端代码里也不要出现在任何公开仓库里正确的做法是放到环境变量中# Windows PowerShell $env:DEEPSEEK_API_KEY你的密钥 # macOS / Linux export DEEPSEEK_API_KEY你的密钥这里的DEEPSEEK_API_KEY是自定义的环境变量名客户端会去读这个值。等号后面对应的脚本就是你的密钥。配置好之后客户端不需要直接接触密钥明文减少泄露风险。4.3 ChatBox 配置服务商、密钥、模型名三步走客户端的选择很多ChatBox、Cherry Studio、LobeChat、NextChat 都是常见选项。我以 ChatBox 为例因为它手机端和电脑端都有界面直观对新手友好。下载安装后进入设置找一个名为「模型服务商」或「AI 服务商」的区域按以下流程配置服务商选「硅基流动」SiliconFlow如果列表里没有就选手动配置填服务商提供的 API Base URL粘贴刚才复制好的 API 密钥模型名称填写deepseek-ai/DeepSeek-R1或 V3 对应的模型 ID具体以服务商页面展示的模型 ID 为准。配置完成后立刻发一条测试消息。我建议第一条消息发一个需要多步推理的问题比如「一个房间里有 3 盏灯和 3 个开关只能进屋一次如何确定每个开关对应的灯」R1 对它处理得特别好能快速验证模型链路是否通畅。ChatBox 这类客户端的优势是你可以同时配多家服务商的密钥界面里手动切换模型。我经常把 V3 和 R1 都配好日常对话用 V3遇到复杂问题切 R1相当于把官方网页版的切换逻辑搬到了自己的客户端里。另外ChatBox 支持把对话上下文导出为 Markdown 或 PDF这对需要沉淀工作结果的人来说非常实用你可以直接把一轮调试过程导出成文档附在代码评审或技术报告后面。4.4 用 Python 直接调 API请求格式、费用控制与上下文管理理解 API 调的请求格式很重要因为所有客户端底层都是这样发请求的。下面是一个标准调用代码使用 OpenAI 兼容格式import requests API_URL https://api.siliconflow.cn/v1/chat/completions API_KEY 你的密钥 # 生产环境必须从环境变量读取不要硬编码 payload { model: deepseek-ai/DeepSeek-R1, messages: [ {role: system, content: 你是严谨的编程助理回答问题前先给出思路。}, {role: user, content: 用 Python 写一个带超时处理的 HTTP 请求函数。} ], temperature: 0.3, # 低温度适合代码任务 max_tokens: 2048, # 限制单次生成长度避免费用失控 stream: False } resp requests.post(API_URL, jsonpayload, headers{ Authorization: fBearer {API_KEY} }) data resp.json() print(data[choices][0][message][content])逻辑说明这个请求和 ChatGPT 的 API 格式几乎一样。messages列表里system消息用来设定模型角色user消息是你的输入。返回结果嵌套在choices[0].message.content里解析路径固定记牢这一层就够了。参数说明max_tokens是单次生成的最大 token 数它同时是费用上限。R1 这类推理模型会先生成一段很长的「思考过程」这些思考 token 也要算钱所以max_tokens设太小会导致回答被截断设太大又费钱。我的习惯是先设 2048 试跑如果发现回答总是在结尾处断裂再往上调。你想查看实际消耗直接从 API 的返回响应里取usage字段里面有 prompt_tokens、completion_tokens 和 total_tokens 三项分别对应输入消耗、输出消耗和总消耗。费用这块是 API 方案最需要留意的。服务商一般会提供余量查询页面你应该养成每次用完瞄一眼的习惯。如果你在企业微信这类场景里接入了 DeepSeek一定要在代码里增加用量记录否则月底账单会给你一个惊喜。5. 避坑清单四个最容易翻车的地方5.1 模型选错R1 挂在日常对话上又慢又贵现象官方网页版或客户端里所有问题都用 R1 回答响应明显变慢API 模式下费用飞快上涨。 原因R1 是推理增强模型无论问题难易都会先生成一段思考链条走 API 时这些思考 token 全部计费。 解决普通对话固定在 V3只有逻辑推理、代码调试、数学题才切 R1。如果你用的是 ChatBox 这类客户端可以同时配两个模型按任务手动切换效果等同于官方网页版的模型选择器但可控性更高。5.2 API 密钥泄露一个 GitHub 推送就能扣光余额现象密钥被写在代码里代码推送到 GitHub 后几个小时后账户出现大量异常调用。 原因公网爬虫会实时扫描 GitHub 代码仓库中的 API 密钥命中后直接盗用。 解决密钥一律放环境变量或者本地配置文件里并且加进.gitignore。如果怀疑泄露立刻到服务商平台删除旧密钥、换新密钥。从那以后我每次提交代码前都会强制搜一遍仓库里有没有api_key字样成本几乎为零收益是避免一笔莫名其妙的高额账单。5.3 蒸馏版当成满血版说「DeepSeek 不行」之前先看模型名现象本地部署 1.5B 后对结果不满意得出「DeepSeek 不过如此」的结论。 原因1.5B 蒸馏版和官方 671B 满血版的能力差距非常大小模型在复杂推理上经常答非所问。 解决先确认自己在用什么模型。本地跑 1.5B 只能验证流程别拿它做重要工作要体验真实能力直接用官方免费版。想升级本地体验按机器内存逐步升级到 14B 或 32B但依然追不上满血版这是物理限制不是配置问题。5.4 上下文被截断长对话突然失忆现象一段对话聊了很久模型开始答非所问或者完全忘记最早的信息。 原因对话内容超过上下文窗口最老的消息被丢弃。 解决新开对话时手动粘贴上一轮的关键结论把上下文显式带过去。这个技巧不管是官方网页版、本地部署还是 API 模式都适用。API 模式下更主动的做法是定期压缩历史消息——把旧的对话内容交给模型做一次摘要再用摘要替换原始消息这是所有长对话应用的通用优化手段。5.5 磁盘空间不足Ollama 装了好几个版本盘满了现象ollama pull下载到一半报错提示磁盘空间不足或者系统变卡。 原因每个模型版本都是独立的几 GB 到几十 GB 文件全下载下来占用惊人。 解决用ollama list查看已装模型用ollama rm删除不再需要的版本。内存不足是另一个引擎如果运行大模型时系统卡死或者 Ollama 进程被系统杀掉这说明物理内存不够。退回小一档的模型或者启用 Ollama 的量化版本这是本地方案最常见的取舍手段。6. 三套方案的选型边界与最小验证法方案不是越高级越好而是越匹配越好。我给你一个可以拿来就用的判断口径你的需求推荐方案理由偶尔问答、写文案、看效果官方网页版 / App零成本满血性能免费代码、数学、多步推理官方网页版切 R1R1 全能力在线数据不出内网、完全离线Ollama 本地部署隐私可控选型受限接企业微信、VS Code、自建服务API 客户端接口标准化、可编程低成本体验 API先跑通流程API 硅基流动有免费额度适合验证选定方案后我建议用同一个测试题去验证所有链路这是最快发现问题的办法。我常用的验证题是「一口井深 10 米一只蜗牛白天爬 3 米晚上滑下 2 米几天能爬出去」这题既能考逻辑答案是 8 天不是 10 天又能观察模型的思考过程。官方版、本地版、API 版分别跑一遍你会立刻感受到蒸馏版和满血版之间的差距有多大也能确认客户端的配置是否正确。还有一个验证技巧值得养成习惯把「思考过程」打开。DeepSeek R1 系列的最大特点就是会把推理步骤输出出来你可以看到它怎么一步步得出结论。官方网页版和 ChatBox 里通常都有查看思考链的入口本地 Ollama 模式会直接在回复里输出。如果你看到的回答只有结论没有推理过程那说明模型不是 R1或者你的客户端没有正确切换到 R1。最后说一句费用习惯无论是在服务商后台还是usage响应里调用一次 API 就应该看一眼消耗。这个习惯帮我提前发现了密钥被盗刷的问题也帮很多朋友控制住了每月预算。我的习惯流程是新配置一个客户端先强制跑一遍上面那道井题确认模型对再问一个开放性问题确认生成正常最后查一次用量页面确认计费正常。三件事加起来不超过五分钟能过滤掉九成配置错误。希望帮到你。本文还有配套的精品资源点击获取