
文档教程知识库人工智能【免费下载链接】ai-guide程序员鱼皮的 AI 资源大全 Vibe Coding 零基础教程分享 OpenClaw 保姆级教程、大模型玩法DeepSeek / GPT / Gemini / Claude / GLM、最新 AI 资讯、Prompt 提示词大全、AI 知识百科Agent Skills / RAG / MCP / A2A、AI 编程教程Harness Engineering、AI 工具用法Cursor / Claude Code / TRAE / Codex / Copilot、AI 开发框架教程Spring AI / LangChain、AI 产品变现指南帮你快速掌握 AI 技术走在时代前沿。本项目为开源文档 aiguide已升级为鱼皮 AI 导航网站项目地址https://gitcode.com/GitHub_Trending/aig/ai-guide点击查看免费下载DeepSeek-R1 是 DeepSeek 团队开源的高性能推理模型其训练管线并非单一的强化学习过程而是由两个监督微调SFT阶段与两个强化学习RL阶段交替构成的四阶段流水线。本文以 DeepSeek-R1的四个训练阶段 为核心骨架结合仓库内 GRPO 算法解析与 V3→R1 架构解读等资料完整拆解冷启动、推理导向 RL、拒绝采样 SFT、全场景 RL 四个阶段的要解决的问题、数据来源与具体方法并深入剖析其中起关键作用的 GRPO 算法原理帮助读者建立起从基座模型到可用推理模型的完整训练认知。为什么需要四个阶段R1-Zero 带来的关键启示要理解四阶段设计必须先了解它的前传。DeepSeek 团队首先基于 DeepSeek-V3-Base 直接使用 GRPO 进行纯强化学习训练得到实验模型 DeepSeek-R1-Zero——该模型完全不需要任何 SFT 种子数据。结果验证了两件事纯 RL 可以激发推理能力在 AIME 2024 数学竞赛基准上R1-Zero 的 Pass1 得分从 15.6% 跃升至 71.0%多数投票下进一步提升至 86.7%接近 OpenAI o1-0912 的水平但纯 RL 存在明显缺陷输出可读性差、语言混合如中英文混杂、格式不统一无法直接产品化。正是基于 R1-Zero 的能力验证 问题暴露DeepSeek 才设计出冷启动 SFT 规避初期不稳定 → 推理 RL 提升能力 → 拒绝采样 SFT 扩展通用性 → 全场景 RL 对齐人类偏好的四阶段方案。最终得到的 DeepSeek-R1 在保留强推理能力的同时具备了规范的语言表达与通用任务能力。四个阶段可用下表一图概括阶段类型核心目标输入模型关键数据/方法第一阶段Cold StartSFT建立规范化推理范式规避 RL 初期不稳定DeepSeek-V3-Base数千条人工收集的高质量长链思维CoT数据第二阶段Reasoning-Oriented RLRL提升数学、代码、科学等复杂推理能力冷启动 SFT 后的检查点GRPO 规则奖励 语言一致性奖励第三阶段Rejection Sampling SFTSFT扩展写作、事实问答等非推理能力推理 RL 后的检查点拒绝采样生成约 60 万推理样本 复用 V3 约 20 万非推理样本第四阶段RL for All ScenariosRL人类偏好对齐提升 Helpfulness 与 Harmlessness第三阶段 SFT 后的检查点规则奖励 神经奖励模型 多提示分布第一阶段Cold Start 冷启动SFT 阶段要解决的问题初始不稳定性和可读性差直接从基模型启动 RL 训练可能导致输出混乱如语言混合、格式不统一。R1-Zero 已经用事实证明了这一点缺乏人类友好的推理模式需要为模型提供初始的规范化推理行为让模型先学会标准答案长什么样再进入强化学习探索。数据来源人工收集的数千条高质量长链思维CoT数据经过格式规范化和多语言对齐处理。具体到仓库中另一篇技术解读的补充细节冷启动数据的构建探索了几种合成方法使用长 CoT 的 few-shot 提示作为示例直接引导模型生成详细回答以可读格式收集 DeepSeek-R1-Zero 的输出再通过人工标注员的后处理来完善结果并过滤掉不易阅读的部分见 DeepSeek技术解读从V3到R1的MoE架构创新。具体方法收集冷启动数据通过少量高质量的长链思维CoT数据训练模型数据来源包括人工设计的示例、DeepSeek-R1-Zero 输出的后处理、以及多语言对齐的格式样本如reasoning_process和summary等结构化标签监督微调SFT用收集的数千条数据对基模型DeepSeek-V3-Base进行微调确保输出格式规范且可读性强为后续 RL 提供稳定的初始策略。冷启动的意义在于搭脚手架既约束了 RL 早期的盲目探索方向又没有限制模型的创新空间。这是 R1 与 R1-Zero 在训练路线上的根本分水岭——DeepSeek 认为基于人类先验知识进行冷启动并迭代训练更适合产出可用的推理模型。第二阶段Reasoning-Oriented RL 面向推理的强化学习RL 阶段要解决的问题提升核心推理能力增强模型在数学、代码、科学等领域的复杂推理性能语言混合问题确保推理过程中使用目标语言的一致性解决 R1-Zero 遗留的语言混搭缺陷。输入模型冷启动 SFT 后的检查点。具体方法GRPO 算法采用分组相对策略优化Group Relative Policy Optimization通过规则奖励如答案准确性、格式一致性驱动模型优化。GRPO 不需要训练价值网络而是对同一提示生成的多个输出一组样本计算组内相对奖励从而大幅降低训练开销语言一致性奖励引入语言比例奖励如目标语言词汇占比当模型在思维链中混入非目标语言时会获得较低的奖励从而减少多语言混合现象。该奖励以 CoT 中目标语言单词的比例进行计算混合奖励信号将准确性奖励与语言一致性奖励直接相加形成最终奖励函数指导模型生成更规范的推理过程。虽然语言一致性奖励可能在纯推理指标上带来轻微下降但其目的是让输出更符合用户的阅读习惯。此阶段主要面向编码、数学、科学和逻辑推理等推理密集型任务——这类任务定义明确、解决方案可客观验证因此适合使用基于规则的奖励。经过该阶段的训练模型会逐步涌现长推理链能力甚至能像 R1-Zero 那样出现自我反思、自我修正的顿悟时刻Aha Moment——模型通过重新评估其初始方法学会为问题分配更长的思考时间这种能力并非通过显式编程或提示工程获得而是强化学习环境中自发产生的涌现能力。第三阶段Rejection Sampling SFT 拒绝采样与监督微调SFT 阶段要解决的问题多领域能力扩展增强模型在非推理任务如写作、事实问答、角色扮演上的通用性数据质量过滤筛选高质量的推理轨迹并生成多样化数据。数据来源推理数据通过拒绝采样从第二阶段的 RL 检查点生成筛选正确的推理轨迹约 60 万条非推理数据复用 DeepSeek-V3 的 SFT 数据集写作、事实问答等约 20 万条。具体方法拒绝采样生成数据从 RL 检查点采样多个响应仅保留正确的推理轨迹并结合生成式奖励模型如调用 DeepSeek-V3 判断质量进行二次过滤。仓库中的 GRPO 详解文档进一步说明这一环节会对每个提示生成多个回答然后仅保留正确的响应并过滤掉混合语言、长段落和代码块的思维链数据混合非推理数据复用 DeepSeek-V3 的 SFT 数据写作、翻译、自我认知、简单问答等总计约 80 万样本推理相关 60 万 非推理 20 万。对于更简单的查询例如你好则不提供 CoT 回答两轮监督微调用混合数据集对模型进行两轮微调两个 epoch平衡推理与非推理能力。拒绝采样Rejection Sampling本质上是一种蒙特卡洛方法当目标分布难以直接采样时用一个易于采样的建议分布生成候选再通过拒绝不满足条件的样本逼近真实目标分布。这里的作用是构建一条从 RL 检查点生成高质量 SFT 数据的数据反哺流水线显著减少对人工标注的依赖这也是 DeepSeek 四阶段训练中极具工程价值的环节。第四阶段RL for All Scenarios 全场景强化学习RL 阶段要解决的问题与人类偏好对齐提升模型的安全性Harmlessness和实用性Helpfulness复杂场景泛化确保模型在开放域问答、长文本理解等任务中表现稳健。输入模型第三阶段 SFT 后的检查点。具体方法多样化奖励信号推理任务沿用规则奖励数学、代码等利用编译器反馈、标准答案比对等可客观验证的信号通用任务使用神经奖励模型评估人类偏好如最终答案的实用性Helpfulness、全响应的无害性Harmlessness。对于有用性只关注最终摘要以最大限度减少对底层推理过程的干扰对于无害性则评估模型的整个响应包括推理过程和摘要以识别潜在风险、偏见或有害内容多提示分布训练结合不同场景的提示数据如用户查询、角色扮演、开放域对话确保模型适应多样化需求二次 RL 训练在收敛的检查点上进一步优化最终得到兼具推理能力和通用性的 DeepSeek-R1 模型。至此DeepSeek-R1 的完整训练闭环形成能力从规范冷启动到提升推理 RL再到泛化拒绝采样 SFT最后到对齐全场景 RL四阶段各司其职、层层递进。核心引擎GRPO 算法深入解析GRPOGroup Relative Policy Optimization分组相对策略优化贯穿了第二、第四两个 RL 阶段是整条训练管线最重要的算法支柱。其核心思想是通过比较同一组内不同候选输出的相对表现来优化策略而不再依赖传统的价值网络。GRPO 的具体实现步骤采样与奖励评分从当前策略模型为同一提示生成多个候选输出即多个策略组并为每个候选输出分配奖励值通常使用二进制奖励如是否正确完成任务简单且有效组内相对奖励对组内奖励进行归一化处理计算每个候选输出相对于其他候选输出的相对优势而非绝对奖励策略更新使用归一化后的奖励计算优势函数通过最大化目标函数更新策略模型——增加选择较好候选的概率同时降低选择较差候选的概率迭代训练重复采样、评估、更新流程逐步优化策略模型。在更新过程中GRPO 还引入 KL 散度约束来控制策略更新幅度防止新旧策略分布偏差过大导致训练崩溃这被称为动态梯度正则化。GRPO 与 PPO / RLHF 的对比对比维度PPO / 传统 RLHFGRPO价值网络需要维护一个与策略模型规模相当的价值网络显存与计算开销大无需价值网络显著降低内存占用策略模型无需额外价值模型参数优势计算依赖价值函数估计优势组内相对奖励归一化简化优势计算训练稳定性策略分布易剧烈变化需复杂裁剪机制组内对比 KL 散度约束降低方差训练更稳定训练效率价值网络训练消耗大量资源省去价值模型训练效率显著提升从工程视角看GRPO 的意义在于对于千亿参数规模的 MoE 模型省掉一个同等规模的价值网络意味着显存与算力的双重解放。这也是 DeepSeek 能用相对更少的算力完成推理模型训练的关键因素之一。总结阶段划分逻辑与四阶段定位两个 SFT 阶段提供初始规范化能力冷启动和扩展多领域泛化性混合数据微调两个 RL 阶段分别针对核心推理能力提升面向推理的 RL和人类偏好对齐全场景 RL核心创新通过纯 RL 激励推理能力无需 SFT 种子的探索结合冷启动和迭代优化最终实现与顶尖闭源模型如 OpenAI-o1-1217匹敌的性能。阶段划分逻辑可以概括为一条逐步收敛的路径SFT 阶段 1冷启动提供初始推理能力与规范化格式RL 阶段 1推理优化提升核心推理性能解决语言混合SFT 阶段 2混合数据扩展通用能力覆盖写作、问答等非推理场景RL 阶段 2全场景对齐最终优化与人类偏好对齐输出兼具推理能力、安全性与实用性的完整模型。值得一提的是训练完成的 DeepSeek-R1 与 R1-Zero 同源于 671B 总参数 / 37B 激活参数的 MoE 架构每个 Token 激活 8 个路由专家上下文长度为 128K。此外DeepSeek 还基于 R1 对 Llama 和 Qwen 系列开源模型进行了蒸馏如 DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-70B 等让 Dense 模型也能获得推理能力——这些内容在仓库的 V3→R1 技术解读中有更详尽的展开。延伸阅读仓库内的 DeepSeek 训练技术资料本文涉及内容可在仓库中继续深入DeepSeek-R1的四个训练阶段本文主体骨架的原始文档DeepSeek-R1的训练流程强化学习RL阶段采用了GRPO算法GRPO 算法的实现细节、AIME 成绩、与 PPO 的深度对比DeepSeek技术解读从V3到R1的MoE架构创新R1 训练流程各阶段的补充细节、R1-Zero 训练与奖励系统设计DeepSeek-R1 技术全景解析从原理到实践的炼金术配方V3、R1-Zero、R1 三者的定位对比与技术演进逻辑DeepSeek-V3 高效训练关键技术分析R1 的基座 V3 在架构、并行策略、通信与显存优化上的高效训练技术DeepSeek技术解析目录查看 DeepSeek 技术分析与模型训练的全部文章入口。赞分享文档教程知识库人工智能【免费下载链接】ai-guide程序员鱼皮的 AI 资源大全 Vibe Coding 零基础教程分享 OpenClaw 保姆级教程、大模型玩法DeepSeek / GPT / Gemini / Claude / GLM、最新 AI 资讯、Prompt 提示词大全、AI 知识百科Agent Skills / RAG / MCP / A2A、AI 编程教程Harness Engineering、AI 工具用法Cursor / Claude Code / TRAE / Codex / Copilot、AI 开发框架教程Spring AI / LangChain、AI 产品变现指南帮你快速掌握 AI 技术走在时代前沿。本项目为开源文档 aiguide已升级为鱼皮 AI 导航网站项目地址https://gitcode.com/GitHub_Trending/aig/ai-guide点击查看免费下载相关推荐DeepSeek-R1强化学习训练全解析无需SFT的推理突破DeepSeek R1强化学习训练全解析无需SFT的推理突破 引言重新定义大语言模型的推理能力边界 你是否还在为大语言模型LLM在复杂推理任务中的表现而基础模型大模型人工智能DeepSeek一文读懂fast_obj数据结构从mesh到纹理坐标的高效存储方案一文读懂fast_obj数据结构从mesh到纹理坐标的高效存储方案 想要快速加载3D模型fast_obj作为一款高效的C语言OBJ解析器其核心在于精心设计DeepSeek-R1训练数据冷启动数据在RL训练中的作用DeepSeek R1训练数据冷启动数据在RL训练中的作用 在大语言模型Large Language Model, LLM的训练过程中强化学习Rein人工智能大模型推理模型强化学习模型评测DeepSeek创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考