ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepSeek-V3 预训练数据分布:从测试成绩反推语言占比与领域覆盖

DeepSeek-V3 预训练数据分布:从测试成绩反推语言占比与领域覆盖 DeepSeek-V3 预训练数据分布从测试成绩反推语言占比与领域覆盖【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3本文基于仓库内公开的 README 与基准测试结果梳理 DeepSeek-V3 的预训练数据分布14.8 万亿 token 的数据规模、训练成本以及由测试成绩推断出的语言占比与领域覆盖情况并给出可执行的验证方法。所有推断均明确标注与官方事实分开。 先说结论官方未公布预训练数据中各语言、各领域的精确占比只披露了总量14.8 万亿14.8Ttokens。从 Base 模型成绩看英语与中文是覆盖最深的两种语言MMLU 87.1、C-Eval 90.1、CMMLU 88.8。代码与数学是最强的领域类别HumanEval 65.2、MBPP 75.4、GSM8K 89.3BaseChat 模型 MATH-500 达 90.2。非英语多语言整体得分 79.4比英语低约 7 分以上低资源语言的覆盖深度有限。预训练耗时 2.664M H800 GPU 小时全程无不可恢复的损失尖峰侧面反映数据处理管线较稳定。为什么值得花时间看这个主题选型部署时语言占比决定你该在哪些语言场景直接用它哪些场景需要额外评测。复现实验或做数据消融时知道数据偏重在哪一类能帮你设定合理的预期。对自建语料的团队14.8T 规模下“英语中文为主、代码与数学加厚”的分布思路本身就是一个可参考的配比样本。下面所有判断都绑定到具体指标或文件路径方便你自行核对。核心证据DeepSeek-V3 预训练数据分布与训练成本以下数字全部来自仓库 README可直接回溯。官方未公布精确的语言/领域分布下文的“占比”判断均为根据测试成绩的推断。类别指标数值备注数据规模预训练 tokens14.8T总参数 671B激活 37B训练成本H800 GPU 小时2.664M预训练全流程 2.788M英语BaseMMLU / BBH87.1 / 87.5MMLU-Redux 86.2中文BaseC-Eval / CMMLU90.1 / 88.8CMath 90.7多语言BaseMMMLU-non-English79.45-shot代码BaseHumanEval / MBPP65.2 / 75.4CRUXEval 67.3 / 69.8数学BaseGSM8K / MATH89.3 / 61.6Chat 版 MATH-500 为 90.2长上下文上下文窗口128KNIAH 全长度通过从项目文档可确认模型采用 FP8 混合精度训练预训练后仅用 0.1M GPU 小时完成 SFT 与强化学习阶段。权重方面Hugging Face 上的 685B 总量 671B 主模型 14B MTP 模块这一点在README_WEIGHTS.md中有说明。语言覆盖与领域覆盖怎么读语言侧中英双核心其他语言有明显落差英语MMLU 87.1、MMLU-Redux 86.2、DROP 89.0且 Pile-test 困惑度 0.548 BPB接近同表最强的 LLaMA3.1 405B0.542。根据公开结果推断英语是数据量最大的语料源学术文本、代码、百科都按英语组织。中文Base 模型 C-Eval 90.1、CMMLU 88.8、CMath 90.7Chat 模型 C-Eval 86.5、C-SimpleQA 64.8在对比的开源模型中领先。推断中文数据占比仅次于英语覆盖教材、百科、网络文本等。其他语言MMMLU-non-English 79.4与英语 87.1 之间约 7 个百分点的落差。这个差距比英中之间的差距大得多说明其他语言日语、西班牙语、法语等合计占比有限属于“可用但不深”的覆盖。领域侧数学和代码加厚百科事实类仍有短板数学与科学Base 模型 GSM8K 89.3、MATH 61.6而 Chat 模型 MATH-500 达 90.2、AIME 2024 39.2。Base 到 Chat 的大幅提升来自后训练蒸馏README 明确提到从 DeepSeek-R1 蒸馏所以竞赛级数学能力更多归功于训练目标而非单纯的数据量。代码HumanEval 65.2、MBPP 75.4、CRUXEval 67.3/69.8 表明代码语料函数级、含执行语义被充分纳入。Chat 模型 Codeforces 51.6 百分位但 SWE Verified 只有 42.0低于 Claude-3.5-Sonnet 的 50.8——仓库级工程任务仍是边界。百科事实TriviaQA 82.9 表现不错但 NaturalQuestions 只有 40.0开放域事实问答仍有提升空间推断该类数据以问答格式为主、覆盖不完整。长文档上下文窗口 128KNIAH 测试在 2K 到 128K 全长度、全深度位置上得分满分下图标色均匀说明训练数据中包含了足以支撑长程定位的长文档语料。关于数据清洗流程仓库未给出细节公开材料只描述数据为“多样且高质量”。训练全程无不可恢复损失尖峰、无回滚据此推断去重与质量过滤环节是完备的但具体算法建议以技术报告为准。✅ 适用场景与能力边界更适合直接使用的场景中英双语文本任务问答、改写、摘要、对话两项语言成绩均在 86 分以上。数学解题与公式推导学校到竞赛入门级别GSM8K 与 MATH-500 成绩稳定领先。Python 等主流语言代码生成与补全HumanEval、MBPP 领先同规模开源模型。长文档处理128K 窗口内的检索、定位、总结可先部署再压测。低成本部署官方仅提供 FP8 权重推理侧 SGLang、vLLM、LMDeploy 均支持 FP8显存占用低于 BF16。需要额外验证或微调的场景低资源语言79.4 的整体分掩盖了单语言差异关键语言需自建测试集单独评估。仓库级软件工程SWE Verified 42.0复杂 PR 修改类任务建议谨慎。开放域事实问答与科学推理NaturalQuestions 40.0、GPQA-Diamond 59.1Chat均非对比表第一。医疗、法律等专业领域公开评测中无专门子项从结果推断覆盖深度一般合规场景应做领域微调并人工抽检。如何快速验证4 步确认语言与领域覆盖打开README.md核对 “Evaluation Results” 两张表Base / Chat确认你关心的指标与本文数字一致。查看figures/benchmark.png与figures/niah.png确认基准对比与长上下文表现。克隆仓库并在inference/下安装依赖起一个最小服务跑你自己的业务测试集建议中英各一组、一组长文档git clone https://gitcode.com/GitHub_Trending/de/DeepSeek-V3 pip install -r DeepSeek-V3/inference/requirements.txt对边界语言或专业领域用小样本各 50–100 条做人工评分再决定是否投入微调。资料入口与延伸阅读README.md模型参数、14.8T tokens 数据规模、完整基准表、本地部署指南第 6 章是判断 DeepSeek-V3 预训练数据分布的第一入口。README_WEIGHTS.md671B 主模型权重与 14B MTP 模块的构成说明。inference/convert.pyHF 权重转换为 Demo 格式inference/fp8_cast_bf16.pyFP8 转 BF16inference/generate.py交互与批量推理入口。inference/configs/config_671B.json等四份配置16B、236B、671B、v3.1 的并行与结构参数。inference/kernel.py、inference/model.py注意力与 MoE 的 Triton 内核实现。LICENSE-CODE/LICENSE-MODEL代码为 MIT 协议模型支持商用。读完后可先做一件事对照 README 基准表里的 C-Eval86.5/90.1与 MMMLU-non-English79.4用你自己的业务问题各测 20 条确认中英落差与低资源语言落差是否符合预期再决定部署范围。【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表