ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI知道你懂多少,但要过多久才会真的“用上“这个判断?

AI知道你懂多少,但要过多久才会真的“用上“这个判断? 你有没有遇到过这种同事他明明知道你是新人但直到项目做到一半才开始放慢语速、少用术语跟你解释。前半程他脑子里其实早就贴好了这人是菜鸟的标签,可这个判断迟迟没有体现在他说话的方式上。这篇论文研究的就是AI身上一模一样的现象。只不过这次的同事是语言模型它在跟你聊天的过程中会不断判断你到底是什么水平,然后呢这个判断被它写进了脑子里很浅的地方但真正拿出来用却要等到聊了很久之后。**核心问题AI记住的东西不等于AI在用的东西**要理解这篇论文在做什么得先搞懂一个技术圈里越来越被重视的区分可解码decodable和可因果作用causally active完全是两码事。Transformer*目前主流大语言模型比如ChatGPT、Llama背后的神经网络架构由很多层堆叠而成信息从输入的第一层一路传递到输出的最后一层。残差流*Transformer内部信息传递的一条主干道每一层处理完之后会把结果加到这条主干道上而不是完全替换掉之前的内容这意味着前面层写下的信息理论上可以一路带到很后面的层。残差流的这个设计带来一个有意思的副作用一层网络如果在很早期就把某个信息记下来了这个信息哪怕之后完全没人用它它依然可以在很晚的层里被读出来。研究者管这个叫可解码用一个探针一个简单的分类器去读某一层的内部状态如果能准确猜出某个属性就说这层可解码这个属性。但可解码不代表AI真的拿这个信息去做了什么决定,这就好比你办公桌抽屉里锁着一份重要文件任何人打开抽屉都能看到它,但这不代表你今天的工作决策真的用到了它。之前已经有几篇论文发现对于那些直接写在输入里的属性比如这个用户是医生这种明说的信息AI经常出现早期就能读出来、但很晚才真正影响输出的情况。这篇论文想问的问题更进一步如果这个属性不是明说的而是AI需要在对话过程中一点点猜出来的呢比如对方到底是新手还是专家这种事没人会直接告诉你得靠聊天过程中慢慢感觉出来。这种需要推理才能得到的信息会不会表现出同样的滞后**用一场角色扮演对话来做实验EXPERTCOLLAB数据集**研究者设计了一个巧妙的实验场景让同一个AI模型Llama-3.3-70B分别扮演两个角色进行关于科研课题的多轮对话。这两个角色分别来自四种身份设定高中生、初级研究者、资深研究者、教授。研究者给每个身份写了详细的性格设定,高中生问的问题偏表面、喜欢用不太准确的类比初级研究者容易被资深的人一压就退缩教授则直接指出方案的致命缺陷从不拐弯抹角。关键的设计在这里这些角色设定里绝对不允许出现我是教授我有十年经验这种直接暴露身份的话。系统提示里明确写着通过你参与对话的方式来体现你的专业水平而不是直接声明它。研究者还专门做了一个泄露检测器去扫描每一段对话确认没有任何一句话直接透露了身份,28段对话全部通过检测。这个设计的用意其实很实际。如果直接在对话里写我是新手那AI要做的事情就变成了简单的关键词匹配跟推理没什么关系了。研究者想测的是那种更接近真实社交场景的能力光靠对方说话的语气、用词、提问方式AI能不能在心里悄悄给对方打分,以及这个打分到底什么时候真正开始影响它自己怎么回话。四个身份等级、四个科研话题图神经网络鲁棒性、投机解码、缩放定律、土壤微生物组组合出28段完整对话每段12轮。这个规模不算大论文自己也承认这只是一次初步验证而不是一个铁板钉钉的定论。**探针实验专业水平信息藏在第8层但很快就消失了**研究者从AI每次即将说话前的那个瞬间去读取它内部的状态一共读了80层里的20个采样层每隔4层读一次。然后用一个简单的线性分类器也就是探针去尝试从这个状态里读出两件事AI自己扮演的角色是什么水平以及AI判断对方是什么水平。结果分成两条完全不同的曲线。AI对自己身份的判断从第0层开始就能以100%的准确率被读出来而且一路保持到最后一层都没掉过。这很好理解因为AI自己的身份是系统提示里写死的属于直接给出的信息架构完全有能力把这种信息原封不动地传到底。AI对对方专业水平的判断则完全不同。准确率在第8层达到峰值0.79满分是1.0四选一蒙对的概率是0.25然后一路下滑到第40层左右就已经掉到接近随机蒙对的水平了。也就是说AI确实很早就感觉出对方是什么水平了但这个感觉越往后传越被冲淡到网络中段基本就找不着了。研究者还做了个对照实验防止这个早期信号只是某种字面小把戏。他们用一个只看表面语言特征的分类器比如犹豫词的使用频率、句子长短、疑问句比例、词汇复杂度去做同样的判断,结果只有0.32的准确率比蒙的高一点但远远不如神经网络探针的0.79。这说明AI在第8层记下的东西不只是简单的这人说话啰嗦所以是新手这种表面统计而是更深层的东西。**反转发生真正决定输出的层是第36层之后**如果故事到这里结束那结论会是AI很早就懂了但后面忘了。但研究者接下来做的因果实验揭示了一个更有意思的真相AI并没有忘,它只是把这个判断压着没用直到很晚才开始真正调用它。这里用到的方法叫反事实激活拼接counterfactual patching。反事实激活拼接*一种因果验证手段找两段场景几乎一样、只有一个变量不同的对话这里是对方的专业水平不同计算它们在某一层内部状态的差异然后把这个差异注入到另一段对话的对应位置看看这个改动会不会一路传导到最终输出。具体操作是这样的研究者找了48组配对对话这些对话场景相同唯一的区别是对方角色的专业水平不一样。他们计算出这个专业水平差异在某一层残差流里对应的向量差然后把这个差值硬塞进另一段对话在同一层的状态里让AI继续往后跑完整个网络最后看输出端的判断有没有跟着变。结果用一个叫归一化因果效应的指标来衡量数值接近1代表这个改动完全传导到了最终判断接近0代表这个改动几乎被网络无视了。在第8层也就是探针准确率最高的那一层,注入这个专业水平差异因果效应只有0.01。几乎等于没有任何作用。这就好比你在一份文件上悄悄改了一个关键数字但审批链条上的每一个人都对这个数字视而不见最后批下来的结果跟你没改之前一模一样。如果不做这个因果实验只看探针的解码准确率研究者很可能会误以为AI在第8层就已经用上了这个判断但实际情况恰恰相反那里的信息虽然存在却对后续处理毫无影响力。而当研究者把同样的注入操作放到第36层往后因果效应飙升到0.86第40层之后更是超过0.90。这意味着同一份专业水平差异信息在浅层几乎是死信息到了网络后半段却几乎能完全左右最终判断,差距超过一个数量级。为了排除这只是随便改一下深层状态都会有大影响这种巧合研究者还做了一个对照换成一个跟专业水平毫无关系、只是长度相同的随机向量去做同样的注入。结果这个随机向量在任何层都没有制造出类似的上升曲线效应始终在0附近晃荡波动区间也宽得多。这说明第36层之后那条清晰的上升曲线确实是专业水平这个方向本身带来的不是随便扰动残差流就能出现的假象。**两种完全独立的检验方法指向同一个转折点**科学结论最怕只靠一种方法撑着。研究者又加了一个完全不需要训练任何探针的检验手段直接算patch前后最后一层激活值的余弦不相似度可以简单理解成改动前后输出内部状态差了多少。这个不需要任何分类器的指标同样在第8层附近开始明显上升到第32层左右趋于饱和跟因果效应曲线的转折点几乎重合。两种完全独立的方法一种靠训练好的探针一种完全不用探针纯靠数学距离竟然指向同一个层区间,这大大增加了这个发现不是偶然巧合的可信度。在实际输出层面研究者还统计了patch前后AI给出的最可能的5个下一个词重合了多少。浅层patch几乎不改变这5个候选词重合率高达0.97而深层patch会让大约三分之一的候选词发生变化。换句话说在AI真正要开口说话的那一刻浅层的那个专业水平判断根本没有参与决策而深层的判断实实在在地在左右它要说的话。**这一切合起来意味着什么**回到开头那个同事的比喻。这篇论文告诉我们的东西其实可以这样理解AI并不是忘了对方是新手这件事它更像是把这个判断先记在了一张便签纸上浅层但真正翻出这张便签、拿来决定该怎么说话的是很晚以后深层才发生的事情。如果一个产品经理只看AI知不知道某件事也就是探针能不能解码出来却不去验证AI有没有真的用上很可能会对AI的能力产生错误的信心。研究者把这个转折点和另一篇论文Lad等人2025年的工作发现的现象联系了起来。那篇论文发现Transformer网络在中点附近会出现一个阶段转换表示开始向词汇空间对齐也就是网络开始为最终输出做准备。这篇论文观察到的因果转折点约第36层网络一共80层差不多正好是中点偏后跟那个转换点对上了号。这提示我们需要推理得到的信息几时才真正被使用可能不是随机分布在网络各处的而是跟网络本身的功能分区有关系。论文最后提出了一个可以被验证或推翻的猜想一个属性越是需要靠推理才能得到而不是直接说出来它从能被读出到真正被使用之间的层数差距就越大。这个猜想目前只有一个对照组的数据支撑AI自身身份vs对方身份研究者自己也承认要真正验证这条规律需要系统地控制信息明确程度从直接说明、到有暗示线索、到完全靠推断逐档去测看因果起效的层数是不是真的跟着单调后移。这篇论文也坦诚地列出了自己的局限只用了一个模型Llama-3.3-70B只有28段对话的小规模合成语料而且扮演双方角色的是同一个模型,这意味着AI某种程度上可能只是在认出自己生成内容的模式而不是真正在做通用的社交推理。层数的具体边界第8层、第36层大概率也是这款模型特有的换个架构未必是同样的数字。对于关心AI对齐和安全的人来说这个发现有一个挺直接的应用提示如果你想去读出或者引导AI对用户的隐含判断比如它是不是在迎合用户、是不是因为觉得对方懂得少就简化了回答你不能只盯着那个探针准确率最高的层去下手,因为在那一层这个信息虽然存在却根本不参与决策。真正要干预得去网络的后半段。写在后面读这篇论文的时候我一直在想一件事探针能读出来的东西到底算不算AI知道的东西这其实是个挺哲学的问题。人类心理学里也有类似的争论,你脑子里存在的记忆跟你在做决定那一刻真正调用的信息从来就不是一回事。心理学家管这个叫内隐知识和可及知识的区别你可能知道某件事但那件事在当下这个决策场景里根本没被激活。AI的这个发现某种程度上是这个现象在神经网络里的一个具体、可测量的版本。论文里有个细节我觉得特别值得单独拎出来说错误的混淆矩阵显示AI搞错专业水平时几乎全部错在相邻等级之间比如把初级研究者错认成资深研究者几乎不会把高中生和教授搞混。这说明AI对专业水平的内部表征其实是连续的、有梯度的不是简单粗暴的四个孤立标签。这跟人类判断陌生人专业水平时的直觉其实挺像的,我们很少会把一个新手和专家完全搞反但经常分不清有点经验和很有经验之间的那条线。还有一个问题这篇论文没有回答但我觉得特别值得追问这个早知道、晚使用的模式是不是AI在训练过程中学到的一种谨慎策略会不会是模型在训练时被隐性地鼓励不要过早对用户下判断直到积累了足够多的证据才敢真正调整自己的行为如果真是这样这不是bug而是一种某种意义上合理的保守主义。这个问题留在那里没有答案但值得继续想下去。
返回列表