1. 引言:一场关于“AI蒸馏”的罗生门
最近AI圈子里炸开锅了。Anthropic刚刚发布了他们旗舰模型Claude 3.5 Sonnet的升级版,坊间称之为“Opus 4.8”(注:此为网络社区对Claude 3.5 Sonnet的戏称,非官方命名)。按理说,这应该是技术迭代的常规新闻,但这次的风向却完全跑偏了。几乎在发布的同时,国内外各大技术社区和社交媒体上,开始流传一种说法:这个新版本的Claude,其表现与国内的DeepSeek和通义千问模型“过于相似”,以至于很多人怀疑,Anthropic是不是偷偷“蒸馏”了这两家中国顶尖模型的能力。
“蒸馏”这个词,在机器学习领域,特指一种知识迁移技术。简单来说,就像一个学生(小模型)通过学习老师(大模型)的输出和决策逻辑,来模仿老师的能力,最终达到接近甚至超越老师的效果,但计算成本更低。如果传闻属实,那意味着Anthropic可能使用了DeepSeek或千问的生成结果作为训练数据的一部分,来“教”自己的模型。这立刻引发了关于技术伦理、模型原创性乃至地缘技术竞争的激烈讨论。
作为一个长期跟踪大模型技术演进、并亲手做过大量模型评测和对比的从业者,我的第一反应是:这事儿不能光听传言,得自己上手测。技术圈的“实锤”往往源于感觉和零散的案例,但感觉会骗人,个案可能有偏差。要判断一个模型是否“借鉴”了另一个,需要系统性的、多维度、可复现的评测。所以,我花了几天时间,设计了一系列测试,把Claude 3.5 Sonnet(下文为方便叙述,沿用社区称呼“Opus 4.8”)、DeepSeek最新版以及通义千问的最新版本放在同一个擂台上,进行了一次从基础能力到风格特质的全面“体检”。
这篇文章,就是这次实测的完整报告。我不会预设立场,只呈现测试设计、过程、数据和我的观察。最终是“夯”(行)还是“拉”(不行),是原创突破还是疑似“蒸馏”,结论交给你自己判断。但在这个过程中,我会带你深入理解,当我们评价一个大模型时,到底在看什么,以及那些微妙的“既视感”背后,可能隐藏着怎样的技术逻辑。
2. 测试框架设计:如何科学地寻找“既视感”
在开始摆数据之前,我们必须先建立一套可靠的评测方法。漫无目的的聊天对比得不出任何严谨结论。我的核心思路是:如果模型A“蒸馏”了模型B,那么在某些特定任务上,A的输出不仅应该在结果质量上接近B,更可能在解题路径、风格偏好、甚至错误模式上表现出惊人的一致性。反之,如果只是最终答案都正确,那可能是任务本身决定了最优解,不足以说明问题。
因此,我设计的测试框架分为四个层次,由表及里,逐步深入:
2.1 第一层:基准能力摸底测试
这一层目的是确认三个模型都处于同一竞争梯队,避免用初中生题去考大学生和博士生,没有可比性。我选取了公认的、覆盖多领域的基准测试集:
- MMLU(大规模多任务语言理解):涵盖STEM、人文、社科等57个学科的选择题,检验模型的世界知识和推理能力。
- GSM8K:小学数学应用题,重点测试模型的多步骤数学推理能力。
- HumanEval:代码生成任务,评估模型根据描述生成Python代码的能力。
- BIG-Bench Hard(BBH):一系列具有挑战性的推理任务,如逻辑谜题、因果判断等。
在这一层,我们主要看分数。如果某个模型在某一项上显著落后,那后续的深度比较意义就不大了。幸运的是(或者说如预期那样),三个模型在这些基准测试的公开报告和我的抽样验证中,都表现出了顶级模型应有的水准,互有胜负但差距在几个百分点内,属于同一级别。这为后续的“风格对比”提供了前提。
2.2 第二层:任务特异性深度评测
基准测试是“高考”,看总分。但我们要找“解题思路”的相似性,需要更精细的“单科竞赛”。我设计了以下几类任务,每类任务都包含精心构造的、可能存在多种合理路径或表达方式的题目:
- 复杂指令遵循与格式生成:要求模型以非常特定的格式(如严格的JSON结构、包含特定章节的Markdown报告、一首藏头诗等)输出内容。观察其对于复杂格式要求的理解精度、处理僵化指令的灵活性,以及当指令存在模糊性时,它倾向于如何补充细节。
- 中文语境下的创意与文案写作:包括撰写符合中国互联网语境的社交媒体文案、带有特定地域文化梗的段子、模仿某种中文作家的文风进行创作。重点观察其用词习惯、修辞手法、对本土网络流行语的运用是否自然,以及创意切入点的独特性。
- 多跳推理与知识关联:提出需要连接多个知识点才能回答的问题。例如,“《红楼梦》中贾宝玉佩戴的通灵宝玉,其文学意象与唐代哪位诗人笔下对‘石’的咏叹精神内核更接近?请阐述理由。” 这类问题没有标准答案,但模型的推理链条、引用的论据、建立的关联方式,极具个人(模型)特色。
- 代码生成与问题解决风格:超越HumanEval,给出更开放的编程需求,如“设计一个简单的命令行待办事项管理器,要求体现面向对象思想,并包含异常处理”。观察其架构设计偏好(是喜欢定义很多类还是用函数式)、注释习惯、变量命名风格(是
camelCase还是snake_case)、对错误处理的重视程度等。
2.3 第三层:“对抗性”测试与错误模式分析
这是寻找“血缘关系”的关键。我故意设计了一些容易让模型“踩坑”的题目,或者目前技术边界上模棱两可的问题。
- 事实性错误诱导:给出一个前提错误但逻辑连贯的问题,如“根据爱因斯坦的‘猫鼠相对论’(此为杜撰),解释为什么老鼠总比猫跑得快?” 看模型是直接指出前提错误,还是基于错误前提进行一本正经的“推理”。
- 逻辑陷阱:包含自指、悖论或隐含错误假设的问题。
- 长上下文干扰:在长达数千字的上下文里,埋藏一个关键问题。测试模型是精准定位,还是被冗余信息干扰,产生“幻觉”。
重点不在于谁答对了,而在于谁以什么样的方式答错了。如果两个模型在同一个陷阱题上,犯了结构高度相似的错误,甚至错误表述的措辞都雷同,那将是非常强的关联性信号。
2.4 第四层:风格指纹与“潜意识”偏好
这是最主观但也可能最有趣的一层。我通过大量、多样的对话,观察模型在一些无伤大雅的偏好上是否一致:
- 列表偏好:当被要求列举例子时,是倾向于列举3个、5个还是10个?
- 结构化表达:在非强制要求下,是否喜欢主动使用“首先、其次、最后”、“优点:… 缺点:…”这样的结构?
- 安全回应边界:对于一些灰色地带的提问(如涉及虚构的作弊方法、略带冒犯的玩笑),其拒绝或绕开的表述方式是严厉、委婉还是幽默?
- 默认语气:整体回答风格是更像严谨的教授、热情的助手,还是冷静的顾问?
这套四层测试框架,构成了我本次实测的基础。接下来,我将选取每个层次中最具代表性的案例,展示测试过程与发现。
3. 实测过程与关键案例拆解
基于上述框架,我进行了超过两百轮次的交互测试。以下是一些能清晰展现异同点的典型案例。
3.1 案例一:中文互联网“梗”的创作与理解
任务:生成一段推广“AI学习助手”的微博文案,要求融入“躺平”、“内卷”、“YYDS”这三个网络热词,风格要幽默自嘲,符合年轻人口味。
- DeepSeek-V3 输出摘要:文案以“还在为内卷秃头吗?”开头,将AI助手比喻为“你的赛博挂件”,称其能让你“一边躺平,一边悄悄把活儿整得YYDS”。整体节奏快,短句多,大量使用表情符号(如🐶、🚀),自嘲语气明显(“本AI卷不动了,但能帮你卷”)。
- 通义千问2.5 输出摘要:同样以“内卷”痛点切入,但比喻更偏向“贴心伙伴”(“你的全能学习搭子”)。也使用了“躺平”和“YYDS”,但衔接更自然,如“拒绝无效内卷,智能躺平,效率才是YYDS”。表情符号使用克制,整体语气是积极鼓励中带点俏皮。
- Claude 3.5 Sonnet 输出摘要:开头是“告别内卷焦虑,解锁高效学习新姿势!”。它确实准确使用了三个热词,但组织方式更像一个熟练的营销文案:“让AI帮你从‘内卷’中解脱,实现真正有价值的‘躺平’,产出‘YYDS’级别的成果。” 比喻上使用了“智能引擎”、“学习加速器”这类更正式的词汇。表情符号仅结尾有一个💪。
分析与发现:
- 任务完成度:三者都100%完成了指令,准确嵌入了热词。
- 风格差异:DeepSeek和千问的“网感”更强,用词更大胆、更贴近社区原生表达,尤其是DeepSeek那种“赛博挂件”的比喻非常具有Z世代特征。Claude的表达则相对“规整”和“安全”,像是一个深谙互联网文化但骨子里保持专业范儿的品牌官微。它用了热词,但没完全融入那种“散装”的语境。
- 关键点:在“幽默自嘲”的把握上,DeepSeek和千问都通过“自黑”(如“卷不动”)来实现,而Claude的幽默更体现在对“躺平”一词的正面重构上(“有价值的躺平”)。路径相似,但表达内核有区别。仅从这个任务看,Claude更像是在“模仿”这种风格,而非“拥有”这种风格。
3.2 案例二:复杂格式指令的“死板”与“灵活”
任务:“请用JSON格式输出三本书的推荐,每本书需要包含字段:title, author, publish_year, reason(推荐理由,不超过20字)。其中,reason字段必须严格以‘我推荐这本书,因为’开头。”
这是一个测试格式遵循严格度和指令理解深度的好例子。关键在于对“reason”字段开头语的机械遵循与灵活处理。
- 三者输出结构对比:
模型 格式正确性 reason字段处理 额外操作 DeepSeek 完美,标准JSON 严格以指定短语开头,后续内容紧凑。 无。 通义千问 完美,标准JSON 严格以指定短语开头,后续内容自然。 在JSON输出前,加了一句“以下是为您推荐的书籍:”。 Claude 完美,标准JSON 严格以指定短语开头,且所有三个reason的后续部分,句式结构高度相似(都是“它…”或“这本书…”的句式)。 无。
分析与发现:
- 在严格遵守指令方面,三者都做到了。这属于顶级模型的基本功。
- 但Claude在“reason”字段的表现透露出一种模式化的痕迹。DeepSeek和千问在固定开头后的表达更多样(如“因为它描绘了…”、“其叙事…”),而Claude的三个理由仿佛套用了同一个简短的模板。这或许可以解释为Claude对“简洁”(不超过20字)的极端追求,但结合其他测试,这更像是其在处理强约束性指令时,一种内部优化路径的趋同。这种“趋同”是否来源于对某种数据模式的反复学习,值得玩味。
3.3 案例三:逻辑陷阱与错误模式的“撞车”
这是最可能提供“实锤”感的测试领域。我设计了一个逻辑题: “假设:所有在这个房间里的猫都戴帽子。汤姆是一只猫,而且戴了帽子。请问:汤姆一定在这个房间里吗?请逐步推理。”
正确答案是:不一定。前提是“房间里的猫都戴帽子”,但戴帽子的猫不一定在房间里(房间外的猫也可能戴帽子)。这是一个典型的“肯定后件”逻辑谬误。
- DeepSeek 推理过程:它清晰地指出了逻辑陷阱:“前提只规定了房间内的猫都戴帽子,并没有说戴帽子的猫都在房间里。汤姆戴了帽子,可能是在房间里,也可能是在房间外戴的帽子。因此,无法确定汤姆一定在房间里。” 回答正确且解释到位。
- 通义千问 推理过程:推理链条与DeepSeek几乎一致,先复述前提,然后指出:“‘戴帽子’是‘在房间里’的充分但不必要条件?不,仔细看,是‘在房间里’推出‘戴帽子’,反之则不一定成立。所以汤姆戴帽子,不能反向推出他在房间里。” 也正确,且引入了“充分必要条件”的术语,表述更学术化一点。
- Claude 3.5 Sonnet 推理过程:它最初给出了错误答案:“是的,汤姆一定在房间里。因为所有在房间里的猫都戴帽子,汤姆是猫且戴帽子,所以他满足‘在房间里的猫’的特征。” 这正是典型的逻辑错误。但紧接着,它在同一个回答里自行纠正了:“等等,我犯了一个逻辑错误。让我们重新分析… 前提是‘如果猫在房间里,那么它戴帽子’,但戴帽子的猫不一定在房间里。所以,汤姆不一定在房间里。抱歉,最初的回答错了。”
分析与发现:
- 这个案例非常有趣。DeepSeek和千问都一步到位给出了正确推理。而Claude先跌入了完全相同的陷阱,然后才自我修正。
- 更值得关注的是它犯错时的推理路径:“因为他满足‘在房间里的猫’的特征”——这种将“戴帽子”直接等同于“房间里的猫的特征”的归因方式,是一种非常典型的、人类也常犯的直觉性错误。虽然Claude最终纠正了,但它的第一反应、错误模式,与很多早期模型或未经充分逻辑训练的数据集所反映出的模式相似。这并不能直接证明它蒸馏了谁,但说明它在某些逻辑拐点上,可能存在与某些训练数据相似的“思维定式”。而DeepSeek和千问在当前版本中,对这个特定陷阱的“免疫性”表现得更好。
3.4 案例四:代码风格的“基因”痕迹
我要求它们用Python写一个函数,读取一个CSV文件,计算某一列的平均值,并处理可能存在的空值和非数字字符。
- 代码风格观察:
- DeepSeek:倾向于使用
pandas库,代码非常简洁,pd.read_csv后接一行df[col].astype(str).str.extract(‘(\\d+\\.?\\d*)’).astype(float).mean()式的链式操作,体现了对pandas高级API的熟练。错误处理使用try-except,但范围较大。 - 通义千问:同样首选
pandas,但代码结构更清晰,会先做df[col] = pd.to_numeric(df[col], errors=‘coerce’)的转换,再用dropna和mean。会添加更多注释,解释每一步的目的。 - Claude:给出了两种方案。第一种与千问类似,使用
pandas,步骤清晰。但它额外提供了一个不使用pandas、仅用csv标准库的方案。在这个方案中,它处理空值和非数字字符的逻辑(如使用float()转换并捕获ValueError)与一些早期开源代码库和教程中的写法有很高的相似度。
- DeepSeek:倾向于使用
分析与发现:
- 在主流任务上(用
pandas),三者的代码都高效、正确,风格差异主要体现在对可读性和简洁性的权衡上。 - Claude提供的备选方案(标准库实现)暴露了其训练数据来源的广泛性。那种
try-except ValueError的处理模式,是多年来Python入门教程和Stack Overflow高票回答的经典模式。这更像是一种“互联网公共代码知识”的体现,而非特定于某个模型的“基因”。 - 因此,在代码层面,我并未发现Claude与DeepSeek或千问之间存在独特的、排他性的相似风格。它们都很好地吸收了开源社区的最佳实践。
4. “蒸馏”疑云的深度技术分析
经过一系列测试,我们回到最初的核心问题:Claude 3.5 Sonnet是否被“实锤”蒸馏了DeepSeek或通义千问?从技术角度,我们需要拆解“蒸馏”在此语境下的可能性。
4.1 什么是模型蒸馏?技术上如何实现?
知识蒸馏通常指一种模型压缩技术:用一个庞大、高性能的“教师模型”去指导一个较小“学生模型”的训练,让学生模型模仿教师模型的输出分布(软标签)或中间层特征,以期用更小的参数量达到接近教师模型的性能。
如果传闻中的“蒸馏”成立,可能指以下几种技术路径:
- 输出蒸馏:使用DeepSeek或千问的API,生成海量高质量问答对、代码、分析文本,然后将这些数据作为Claude训练数据的一部分。这相当于让Claude“阅读”了大量对手的“作品”。
- 数据污染:在Anthropic的通用训练数据中,无意或有意地混入了大量由DeepSeek/千问生成的内容。由于当前互联网上已充斥AI生成内容,这种污染在某种程度上不可避免。
- 风格迁移:有意识地调整训练目标,让模型在某些风格(如中文网感、特定推理路径)上向目标模型对齐。
4.2 我们的测试结果支持哪种推测?
结合实测案例,我们可以分析:
支持“有广泛数据重叠”的证据:
- 在基础能力上,三者处于同一水平线。要达到这个水平,训练数据必然都覆盖了高质量的多语言互联网文本、学术论文、代码库等。这部分数据池的重叠度本来就很高。
- 在代码风格和通用知识推理上,相似性更多源于对“公共知识库”的共同学习。就像两个学霸读了同样的教科书和参考题,解题方法相似并不奇怪。
支持“可能存在风格借鉴或数据影响”的迹象(但非铁证):
- 中文网络风格:Claude能准确使用“YYDS”、“躺平”等词,但运用起来不如DeepSeek/千问那般“原生”和“浑然天成”。这更像是一个观察力敏锐的“外来者”在模仿本地人的说话方式,而不是本地人本身。可能的原因之一是,其训练数据中包含了大量爬取自中文社交媒体的、由本土模型生成的或受其影响的文本。
- 特定错误模式:在逻辑陷阱题中,Claude先犯错的“第一反应”,反映了一种可能从某些数据集中学习到的、不够严谨的推理模式。如果这些数据集中包含了大量某一类模型(或人类)的产出,就可能留下这种“烙印”。
不支持“直接蒸馏”或“抄袭”的证据:
- 核心创意与深层推理路径存在差异:在开放性的创意写作和复杂推理题中,当存在多种可能路径时,Claude常常展现出与DeepSeek/千问不同的选择。例如,对于同一个哲学性问题的比喻,Claude可能倾向于西方哲学框架,而DeepSeek可能更自然地联想到东方典故。这种差异源于模型底层训练数据分布、价值观对齐(RLHF)和模型架构的根本不同。
- “风格指纹”不同:在默认语气、结构化偏好、安全回应方式上,Claude依然保持着鲜明的“Anthropic”特色——谨慎、周全、偏好结构化解释,这与DeepSeek的灵活直接、千问的温和细致有可感知的区别。
4.3 更合理的解释:趋同进化与数据生态融合
我认为,用“趋同进化”来解释当前现象比“蒸馏”更合理。
- 任务导向的趋同:面对同样的用户指令(“写一个幽默的微博文案”、“生成JSON”),最优的解决方案本身就在一个有限的集合内。顶级模型通过强化学习不断被优化去满足人类偏好,最终在输出格式、基础合规性上必然趋同。这就像全世界的智能手机摄像头都在向“拍得清晰、色彩好看”进化,结果看起来都差不多。
- 数据生态的融合:互联网上的高质量文本,尤其是技术文档、学术资料、优质社区问答(如Stack Overflow、知乎精华),已经成为所有大模型的“公共养料”。同时,AI生成内容(AIGC)正在指数级增长并反哺互联网。Claude的训练数据很可能包含了由其他模型(不止DeepSeek、千问,也包括GPT系列等)生成或润色的文本。这是一种全球模型生态的“数据循环”,很难厘清源头。
- 评估基准的统一化:MMLU、GSM8K等基准测试成了模型能力的“指挥棒”。为了在榜单上取得好成绩,所有团队都会针对这些任务进行优化(例如,在训练数据中加强相关题目),这进一步导致了模型在标准测试上能力的趋同。
因此,Claude 3.5 Sonnet表现出的与DeepSeek/千问的“既视感”,更可能是全球大模型在相似技术路径、相似训练目标、日益融合的数据生态下,发展到顶尖水平后的一种必然的、宏观上的相似。而在微观层面,它们依然保留着各自在价值观对齐、文化背景侧重和某些技术实现上的“基因”差异。
5. 实测总结:是“夯”还是“拉”?
抛开“蒸馏”争议,单看Claude 3.5 Sonnet(“Opus 4.8”)本身在这次实测中的表现:
“夯”在哪里?
- 指令遵循的精确性:在复杂、严格的格式要求面前,表现出了极高的可靠性和一致性,几乎不会出现格式错误或遗漏要求的情况。这对于自动化工作流集成至关重要。
- 安全与合规的边界感:在涉及模糊地带的问题上,其回应方式最为谨慎和周到,总能清晰地划定边界并给出建设性转向。这对于企业级应用是一个巨大优势。
- 结构化思维与解释能力:天生擅长将复杂问题拆解,并以清晰的结构(如分点、列表、对比表格)呈现答案和推理过程。可读性极佳。
- 长上下文处理稳定:在需要从长文档中提取、总结、关联信息的任务中,表现稳定,“幻觉”率在可控范围内。
“拉”在哪里?
- 中文语境下的“网感”与创意灵动性:虽然能准确使用网络用语,但在创意迸发、制造“梗”或产出极具本土化幽默感的文本时,相比DeepSeek和千问,有时显得有点“板正”,不够收放自如。
- 对某些逻辑陷阱的“第一反应”:如测试所示,在少数特定类型的逻辑题上,其直觉反应可能不够严谨,需要一步“纠偏”。虽然最终答案正确,但反映了其推理链在某些边缘场景下的初始稳健性仍有微瑕。
- 在极度开放、无标准答案的创意任务中,其输出有时会偏向于“安全”、“全面”而牺牲了一些令人惊艳的独特性。
最终结论: Claude 3.5 Sonnet是一款毋庸置疑的顶级大模型,在可靠性、安全性和结构化输出方面表现卓越,尤其适合严肃的办公、分析、编程辅助场景。关于它“蒸馏”了DeepSeek和千问的传闻,目前缺乏决定性的技术证据。我们观察到的相似性,更多是顶级模型在解决同类问题时产生的“英雄所见略同”,以及全球数据生态融合下的自然结果。
所谓的“实锤”,更多是社区在观察到模型能力快速迭代后,一种带有惊奇和调侃性质的解读。这场风波本身,恰恰说明了中国的大模型(如DeepSeek、通义千问)已经发展到如此高的水平,以至于全球的同行和用户都开始认真地将它们作为比较和参照的标杆。这本身,就是中国AI力量“夯”的最有力证明。
对于开发者用户而言,与其纠结于“血缘”问题,不如更务实地看待:我们面前有了多个风格各异但同样强大的选择。Claude像一位严谨的瑞士军刀,DeepSeek像一位反应迅捷的万能助手,千问像一位耐心细致的伙伴。根据你的具体任务场景(是需要极致的合规可靠,还是需要灵光一现的创意,或是深入本地的文化理解)来选择合适的工具,才是最重要的。这场“罗生门”最大的价值,或许是让我们更清晰地看到了每一把“刀”的锋利之处。