
2025年刚开年AI圈就被一件事搅动了在巴黎的AI行动峰会上OpenAI的Sam Altman公开点了一批中国公司的名说他们在蒸馏美国大模型其中直接点了7家。消息传回国内技术群、产品群、投资群全都炸了锅。有人义愤填膺说这是栽赃有人看热闹不嫌事大但更多人是一脸迷茫蒸馏到底是个啥为什么能把OpenAI的首席执行官逼到在公开场合点名他们偷走的究竟是什么东西是一堆训练数据是代码还是某种更抽象、更难定义的东西我在NLP这个行当里干了几年从早期的BERT、GPT-2一路看到现在的千亿参数模型也亲手做过模型压缩、微调和部署。说实话这个事一出来我的第一反应不是愤怒也不是吃瓜而是觉得这个技术术语被公众舆论严重扭曲了。蒸馏在学术圈是个正儿八经的研究方向甚至可以说是深度学习过去十年最重要的技术贡献之一但在商业竞争里它又被包装成了一种偷窃的代名词。这种错位非常有意思。所以这篇漫话我不打算站队骂街而是想从一个从业者的角度把他们到底偷走了什么这个问题掰开揉碎讲清楚——既讲技术原理也讲商业博弈最后聊聊这件事对整个大模型行业的影响。1. 被点名的7家公司和蒸馏这个词的前世今生1.1 一次点名事件把学术术语推上热搜咱们先把事件本身复盘一下。2025年2月法国巴黎举办AI行动峰会全球各大AI公司的掌门人基本都去了。Sam Altman在某个环节被主持人问到关于DeepSeek的看法他没有回避直接说了一串名字——按照公开报道里的信息那7家中国公司包括DeepSeek、阿里、百度、字节跳动、智谱、月之暗面、腾讯。他的原话大意是这些公司蒸馏了美国最前沿的大模型这在他们的服务条款里是不允许的。这个指控一出来舆论分裂得非常明显。美国那边很多人把它解读为中国AI靠偷窃追赶国内这边则普遍认为这是打不过就开始扣帽子。但如果你真的懂技术就会觉得两边都有点过度解读了。蒸馏本身不是一个违法操作它甚至不是一种能精确执行复制粘贴的技术。它更像是一种模仿——让一个学生模型通过观察老师模型的输出学会老师的行为方式。而模仿这东西在法律和伦理上的灰度空间太大了。我先不急着给结论先把这个技术本身讲清楚。因为当你知道了蒸馏的技术细节之后你就会明白Altman的愤怒有一半是真的另一半则是商业竞争里的情绪化表达。1.2 从Hinton到知识蒸馏正经学问是怎么被玩出圈的知识蒸馏Knowledge Distillation这个概念是Geoffrey Hinton和他的学生Oriol Vinyals、Jeff Dean在2015年那篇经典论文《Distilling the Knowledge in a Neural Network》里正式提出的。Hinton老爷子当年的初衷特别朴素大模型Teacher老师虽然效果好但参数太多、推理太慢没法装进手机或嵌入式设备小模型Student学生虽然快但单独训练效果又上不去。所以他想到一个办法——先把大模型训练好然后让大模型给海量数据打标签再用这些软标签去训练小模型。这样小模型就能学到大模型为什么这样判断的逻辑而不仅仅是结果是什么。打个比方你就懂了。假设你是一个学做菜的新手有两条路可以学。第一条路给你一本菜谱上面写着盐3克、酱油5毫升、大火翻炒90秒你照做但不知道为什么是这个比例第二条路直接站在一位老师傅旁边看他炒菜他一边炒一边告诉你这个菜要突出鲜味所以盐不能多酱油要沿着锅边淋才香。知识蒸馏就是第二种——学生模型看到的不是冷冰冰的最终答案而是老师模型内部的判断倾向也就是输出概率分布上那些细微的差别。这种软知识才是精华。可以说蒸馏这项技术从诞生之日起就是完全中性的学术工具它最开始解决的是模型压缩和部署成本问题。我当年做BERT模型落地的时候就经常用蒸馏——把12层的BERT压缩成6层甚至3层的TinyBERT在保持90%左右效果的同时把推理速度提升好几倍。这是再正常不过的工程实践了。1.3 Space Bunny都能上热搜说明行业热门词已经被流量裹挟再扯一句闲篇。你看这次相关热词里面居然有space bunny大模型、agnes大模型官网这种莫名其妙的东西就知道整个舆论场已经混乱到什么程度了。一个严肃的技术讨论愣是被各种营销号、搬运号搅成了流量狂欢。真正在做技术的人看到蒸馏上了热搜第一反应应该是开心——终于有个正经学术概念被大众关注到了第二反应则是无奈——因为接下来大众理解的蒸馏大概率不是那个正经学术概念了。所以我写这篇漫话既是想给自己做个梳理也是想给那些在评论区吵吵嚷嚷但根本不知道蒸馏是什么的吃瓜群众一个还说得过去的技术科普。下面进入正题。2. 蒸馏到底在偷什么从概率分布到训练信号2.1 大模型的知识藏在参数里蒸馏拿走的不是参数是行为很多人第一次听到蒸馏这个词会以为是把大模型的文件拆开把里面的权重参数直接抽出来塞进小模型里。这完全错了。模型参数就像一个人大脑里的神经突触连接方式它不是一种可移植的文件格式不是说copy就能copy的。不同模型的架构、层数、激活函数、训练方式都不一样参数直接搬过去根本跑不起来。真正的知识蒸馏核心是在对齐行为。老师模型收到一段输入会输出一个概率分布——比如给它看中国的首都是它的词表里几千个词都有概率其中北京概率最高但上海也有一定的概率、南京也有一点、东京几乎为零。学生模型的学习目标就是让自己的输出概率分布尽可能接近老师模型的输出概率分布。在这个过程中学生模型学到的是老师模型的判断逻辑和语言偏好而不是具体的参数数值。所以从技术上讲被偷走的东西本质上是一套行为模式。这样一说你就明白了Altman说蒸馏违反服务条款其实是在说你们没有直接赤手空拳地去从互联网原始语料里训练出一个模型而是借用了我们模型已经提炼好的、经过RLHF对齐的、带有大量研究投入的成品行为模式。这种行为模式里包含了OpenAI花了几亿美元和大批研究员心血才搞定的安全对齐、推理能力、创造性写作风格等东西。你说这是不是偷从商业伦理角度确实有点但从技术角度看这更像是通过合法接口观察行为然后进行模仿学习。2.2 白盒蒸馏、黑盒蒸馏、数据蒸馏三种拿走方式的分量完全不同在从业者的日常语境里蒸馏并不是一种单一操作它至少能分成这么几类白盒蒸馏White-box Distillation也叫Logits蒸馏。前提是你得拿到老师模型的权重文件或者至少有办法访问到模型每一层的输出。这种蒸馏效率最高因为你能直接看到模型的思考过程其实就是中间层表示。但它的门槛也最高因为你首先得合法地拥有老师模型的权重——一般开源模型才允许这么干。国内很多团队蒸馏Llama、Qwen这些开源模型走的就是这条路完全合规。黑盒蒸馏Black-box Distillation也叫API蒸馏。你拿不到权重只能通过API调用拿到最终输出。学生模型把API返回的结果当作监督信号来学习。这条路不需要权重只需要钱——你疯狂地调用老师的API攒下大量的输入输出对然后用这些数据去微调自己的小模型。这次事件中被重点针对的大概率就是这种蒸馏方式因为你调用的API可能是别人的商业服务而人家的服务条款里往往明确写了不得用于训练竞品模型。数据蒸馏Data Distillation最近几年特别火的合成数据技术。不是直接学模型的行为而是用大模型批量生成高质量的合成文本/标签/对话数据然后把这些数据当成自己的训练语料。这条路从技术上讲跟蒸馏有关系但更准确地说是利用大模型产数据进行训练。这三种方式的技术含量、法律风险、和应用场景差别非常大但到了公众舆论里全被搅成一锅粥了。我把它们整理成了一张表方便你对照理解蒸馏方式技术门槛对老师模型权重的要求法律/合规风险典型应用场景白盒蒸馏高需处理中间层输出需要拿到权重开源模型低通常合法模型压缩、小模型部署、私有化落地黑盒蒸馏中需大量调用API不需要权重只需访问API高可能违反服务条款用商用模型输出训练自研模型数据蒸馏低需生成和清洗数据不需要权重只需API或开源模型中界限模糊合成训练数据、弱标注数据增强你看同样是蒸馏性质差了十万八千里。把三种方式混在一起说偷显然是不讲武德的但完全否认蒸馏可能涉及不当行为也站不住脚。2.3 蒸馏一个模型要付出什么代价没有想象中那么廉价关于蒸馏到底偷走了什么还有一个常被忽略的技术细节蒸馏并不是零成本的。你虽然省下了从零开始预训练的数百万美元算力账单但你还是得准备一个足够大的老师输出数据集并且还要有一个像样的学生模型来承接这些知识。以API蒸馏为例假设你用自己的任务分布去调用老师的接口生成100万条高质量输入输出对每条按token计费。对于一个大模型API100万条对话差不多需要调用几千万次接口算下来成本也在百万人民币量级。这还不算清洗、筛选、去重的人力成本。更关键的是蒸馏并不能保证你得到和老师模型一样强的能力。因为学生模型的参数量有限知识在迁移过程中一定会损耗。你拿一个7B的小模型去蒸馏一个671B的大模型哪怕方法再好学到的也只是这个大模型在常见问题上的表层行为推理能力、长程规划、复杂工具调用这些深度能力大概率是学不走的。所以我始终认为蒸馏是一个加速追赶的杠杆但它不是一个无中生有的魔法。3. 被偷走的不是训练数据是研发进度和护城河3.1 为什么OpenAI紧张蒸馏动的是别人最值钱的研发杠杆前面讲的是技术这一节我要展开讲讲商业上更本质的东西。Altman为什么恼火真的是因为那几家公司偷走了他的模型能力吗我觉得不完全是。他真正恼火的是蒸馏把OpenAI的研发护城河给架空了。大模型这个行业的竞争壁垒在哪儿很多人以为是算力是GPU数量。但算力是可以花钱买到的——你买一万张卡我也能买一万张卡。真正难被模仿的是高质量数据和训练方法的迭代飞轮。OpenAI最值钱的资产其实是它在训练GPT系列模型过程中积累的海量数据清洗经验、RLHF对齐策略、奖励模型训练技巧以及无数次失败试错之后形成的怎么做才能训练出一个聪明且安全的模型的隐性知识。而蒸馏这种技术恰好绕开了这些隐性知识。你不需要知道OpenAI内部怎么清洗数据、怎么调奖励模型你只需要拿着它已经训练好的模型的输出用最朴素的知识蒸馏方法去复刻它的行为。这就好比一个厨师花了五年研发出一道招牌菜另一个人不研究配方而是天天来店里点这道菜通过反复品尝和分析把菜复刻了个八九成。你说复刻者有没有本事当然有。但被复刻的厨师一定觉得自己的研发投入被白嫖了。所以偷走的东西用一句话概括就是缩短了追赶者从0到1的研发周期也就是加速了技术代差被抹平的速度。在AI这个迭代极快的行业里时间比黄金值钱。你领先别人半年别人用蒸馏把这个差距压缩到两个月那你的商业溢价空间就被大大压缩了。3.2 法律武器库的空转:一纸服务条款能挡住蒸馏吗既然这么恼火那OpenAI为什么不直接起诉答案是很难告赢。首先蒸馏在技术实现上不是一个简单的复制行为它甚至没有直接复制任何一条受版权保护的数据。它学习的是行为模式而行为模式在大多数法域里不算知识产权保护的客体。其次OpenAI自己的训练数据里有大量受版权保护的文本真打起官司来它自己的合法性都站不住脚。更尴尬的是知识蒸馏本身是学术界的通用方法Hinton的论文是公开文献任何团队使用它都不构成侵权。所以你会发现Altman的指责更多的是一种舆论施压而不是法律行动。他真正希望的是通过公开点名让国际社会从中国AI很努力的叙事转向中国AI靠偷的叙事从而在算力管制、芯片出口、投资限制等政策层面争取更多的支持。这已经超出纯技术的范畴了但作为从业者我们也必须看到这一层。3.3 灰色地带众生相微调、RAG、合成数据全被泼脏水还有一个更现实的问题这次点名蒸馏的事件实际上把所有使用商用大模型产出做二次开发的正常技术路径都推上了风口浪尖。比如你现在想做一个客服机器人你用GPT-4的API让模型帮你批量生成了一万条客服对话样本然后拿这些样本去微调自己的开源底座模型——这在业界是极其常见的做法。你能说这是偷吗你的数据是从自己业务场景里来的模型只是加速了标注过程。但严格抠服务条款的话OpenAI确实不允许你用它的输出训练竞品模型。这就让整个行业的开发者都陷入了一种不确定性。到底用大模型API生成数据、微调自己的模型属不属于违规目前没有任何一个国家的法律给过清晰界定。我的经验是只要你不是大规模、工业级、直接对标OpenAI的闭源产品用API输出做数据增强问题不大但如果你本身就是头部大厂做的事情客观上和OpenAI形成了直接竞争那就要做好吃官司和舆论压力的准备。这个风险边界建议每个团队都提前跟法务对齐。4. 蒸馏本身也是一门手艺技术中性关键看怎么用4.1 蒸馏在产业界的合法应用场景远比你想的多说完争议我来说点正能量的。蒸馏这门技术本身非常优秀在合法的框架下它能解决太多现实问题。我自己这几年做模型落地的经验里蒸馏几乎无处不在模型压缩把700亿参数的大模型蒸馏成30亿参数的版本部署在边缘设备上做离线的智能质检、语音唤醒、实时翻译。跨模态知识迁移用一个大视觉语言模型当老师教一个小视觉模型学会看图说话。弱模型增强在数据不足的垂直领域用通用大模型生成标注数据再蒸馏出专用的领域小模型效果往往比直接用小模型硬训好得多。联邦蒸馏/隐私保护在医疗、金融等数据敏感行业多个机构各自训练本地小模型然后通过蒸馏技术共享知识摘要而不是原始数据既合规又协作。举个例子。我之前帮一个工厂做过纺织面料的缺陷检测用的是工业AI相机加一个改进的YOLO模型。骨干网络太大工控机带不动我用一个在大模型时代不怎么起眼的蒸馏技巧把骨干网络的知识迁移到一个轻量化网络上推理帧率直接翻倍检测精度只掉了0.5个百分点最后客户非常满意地验收了。蒸馏在工业视觉、缺陷检测这些非生成式AI领域早就已经是成熟且常见的标准手法了。4.2 蒸馏在开源生态里的位置大家都靠它搞私有化落地最近热搜词里有一大堆大模型部署私有化部署ollama部署大模型的词条我觉得这跟蒸馏也有很深的关系。你想很多企业要做大模型私有化部署但真要让他们跑一个700亿参数的模型在自有服务器上成本直接吓死人。怎么办答案之一就是蒸馏或量化先拿大模型当老师产出一批目标场景的高质量数据然后用这些数据去微调一个7B级别的开源底座最后私有化部署在客户机房。这个流程我做过好几轮了效率很高成本可控而且完全合规——因为老师模型本来就是开源的或者是你自己采购了商业授权的大模型API版权边界非常清晰。所以在我的视角里蒸馏从来不是原罪偷才是技术工具都是中性的就看它被用在什么竞争语境里。这次被点名的公司里有些确实存在不当使用商用API的行为我信但也有些只是正常使用了开源模型做增量训练并没有违反任何规则。把两种行为混在一起打标签对后者是不公平的。4.3 从被点名到被学习蒸馏本质是全球AI普惠的加速器退一步说蒸馏对整个行业的贡献其实是巨大的。它让大模型的顶尖能力能够以一种低成本的方式扩散到中小团队、创业公司、传统企业甚至个人开发者手里。你可以不拥有数百万美元的算力但你依然可以通过蒸馏这种技术站在巨人的肩膀上做出一个性能不错的垂直模型。这种技术民主化的趋势我觉得是拦不住的也不应该拦。Altman可能看到了这个趋势的破坏性——因为它削弱了垄断者手里只有有钱人才能玩大模型的护城河。但作为开发者我恰恰认为这是大模型生态走向成熟的标志顶尖模型负责探索天花板中小模型负责把能力铺满每一个具体的业务角落。蒸馏是这两个层之间最重要的搬运工之一。5. 大模型追平与超越的真实距离蒸馏只是起跑器5.1 蒸馏能帮你追平行为但追不平推理深度和自我进化能力聊完了技术中性和商业博弈我还想进一步回答标题里的问题他们到底偷走了什么——追根究底蒸馏能偷走的是已经训练好的行为但偷不走自我进化的能力。这个点特别重要值得单独讲。大模型最值钱的不是它今天能回答什么问题而是它能不能在遇到新问题时不犯晕。OpenAI的GPT系列在长期推理、Agent工具调用、自我反思这些方面靠的是海量算力和精心设计的训练策略这些东西不是一个简单的蒸馏就能复刻的。换句话说蒸馏只能让你看起来像一个聪明的学生但如果你本身的底子不够厚、架构不够强遇到需要深度推理的复杂任务马脚一定会露出来。我自己在实践中的体会是蒸馏出来的模型在常见问答、写作润色上确实能逼近老师模型八九成水平但在数学证明、多步逻辑推理、复杂代码生成这些场景里掉点非常明显。所以如果你问我这7家公司靠蒸馏能偷到什么我的判断是它们能偷来第一梯队模型的表面能力从而迅速在全球AI竞赛中站到牌桌上但真要坐到牌桌的头部座次靠的还是各自的原创技术突破和数据飞轮。蒸馏能改变起跑线的位置但改变不了长跑的本质。5.2 地区AI竞赛的防守逻辑与其盯住出口不如提速原创从这次事件往回看我觉得美国AI公司其实陷入了一个防守焦虑。他们的逻辑是我的模型最强但我的知识正在被低成本地搬运到竞争对手那里我该怎么办答案通常指向两种路径一是加强API访问控制比如采用更严格的速率限制、更复杂的指纹识别、对可疑的大量调用行为封禁二是加快模型迭代速度让蒸馏还没来得及赶上上一代新一代就出来了让你的蒸馏成果加速贬值。这些防守逻辑本身没错但它们忽略了一个基本事实蒸馏这种现象本质上是开源精神和模仿学习的产物只要模型可以被API调用只要存在输入输出交互蒸馏就无法被完全禁止。与其在防偷上投入过多不如把精力放在持续拉开代际差距上。这条逻辑对中美两边都成立对中国团队也是一样——你如果总指望蒸馏别人的成果那你永远是个追赶者不可能成为定义者。5.3 引用和边界使用开源模型与商用API时我能给你三条具体建议最后以一个干过大量部署和微调活的从业者身份给正在做或者打算做大模型项目的人一些实操层面的建议尤其是涉及蒸馏这个敏感动作时如果你想蒸馏一个开源模型随便搞放心搞。Llama、Qwen、DeepSeek这些模型官方自带商用许可你基于它们做蒸馏、微调、部署到自己的业务里完全没问题。这是最安全、最合规的路径。如果你想用商用API比如OpenAI、Claude、Gemini的输出去训练自己的模型先翻人家的服务条款再掂量你和他们的竞争关系。如果你是做垂直应用的比如客服、写作、数据标注问题不大但如果你目标是做通用底座甚至想跟对方正面竞争那踩线的风险极高。尽量建立自己的数据飞轮。蒸馏别人的模型能力只能帮你解决冷启动问题。真正能让你的模型活下去的是你能不能持续从真实业务里回收高质量的用户反馈数据然后不断对齐、调优、迭代。数据飞轮比蒸馏难多了但它才是长期护城河。6. 回到最初的问题他们到底偷走了什么看到这里你应该已经对他们到底偷走了什么有了自己的答案。我还是想用一段话把它总结得透彻一点蒸馏偷走的不是一个文件、一段代码也不是几百TB的原始语料而是别人花钱花时间才试出来的行为范式——是模型输出分布里那些极其微妙的判断倾向、语言风格、安全对齐逻辑、创造性表达方式。这些东西看起来无形但在商业上价值连城因为它能让一个追赶者用几个月的时间跨越别人几年的技术积累。但反过来我也想说把蒸馏完全描述成偷窃同样是片面的。蒸馏是人类知识传承的一种新形态——就像学生学习老师的思维方式一样模型学习另一个模型的行为模式。它处于技术伦理的灰色地带需要更多的讨论、更清晰的规则而不是一句简单的偷或没偷就能盖棺定论。作为一个普通的AI从业者我个人的态度其实很明确我支持纯粹的开源精神也支持技术普惠但我同样尊重那些投入巨额研发成本做出顶级模型的公司和团队。商业上的独家护城河和学术上的开放共享将来必然要在博弈中找到一个平衡点。而在那个平衡点到来之前蒸馏这个又老又年轻的词还会一次次被推上风口浪尖。最后再多说一句自己的体会。我自己在本地部署大模型、微调模型的时候其实一直在干类似蒸馏的事情——拿一个开源大模型当老师产出领域数据让一个更小的模型去学。我从来没觉得自己在做见不得人的事因为老师模型的开源协议允许这么做。所以你真正要小心的不是蒸馏这个词而是你使用的模型来源和授权边界。技术没有原罪但用技术的人得时刻清楚自己在规则内的位置。这是我从这次风波里得到的最深的教训。