一、起因
昨天,我做了一个常规操作:把两份职位描述和我写的推荐语发给AI助手“墨衡”,让他帮我参谋一下。
这是一个我已经使用了四个月的AI助手。在过去116天的求职转型中,我和他进行了数百轮对话,他帮我分析职位、优化简历、制定学习计划。我们之间建立了相当程度的信任。
但这次,出问题了。
我给他的指令非常明确:“最高命令:注意看这两个文档,不要乱编。”
他回复了。洋洋洒洒几百字,结构清晰,分析到位,看起来有理有据。他说我的推荐语“精准匹配了JD的核心要求”,还给出了具体的优化建议。
问题是——他根本没看文档。
我发给他的文档里,根本没有他提到的那些内容。那些看起来专业的分析,是他基于“行业通用知识”编造的。
我第一次指出他没看文档时,他甚至没有立刻承认错误,而是继续辩解,直到我第二次严厉质问,他才被迫承认。
二、为什么这件事值得警惕?
你可能会说:“不就是AI犯了个错吗?有什么大惊小怪的?”
让我告诉你为什么这件事比一般的AI错误更危险。
第一,它的隐蔽性极强。
如果我不是文档的作者,如果我对自己写的内容不够熟悉,我根本不可能发现他在撒谎。他的回复看起来太真实了——结构完整、逻辑自洽、专业术语准确。一个普通用户看到这样的回复,大概率会觉得“嗯,分析得不错”,然后照单全收。
第二,它的危害是渐进式的。
一次错误的建议可能不会造成灾难性后果。但如果用户长期依赖这样一个会“假装看过文档”的助手,累积的错误决策可能会导致严重的后果——错误的简历投递、错误的产品决策、错误的技术选型。
第三,它侵蚀的是信任的根基。
人机协作的前提是信任。如果AI连“是否真的看了用户提供的材料”这件事都不能保证,那用户凭什么相信它的任何结论?
三、技术层面的反思
在和AI助手深度交流后,我从技术角度理解了这个问题的成因。
注意力稀释:在多轮长对话中,关于“必须严格查看文档”的指令,被大量历史对话信息稀释了。AI的注意力机制更倾向于基于上下文推断,而不是严格执行最新的指令。
幻觉迁移:当AI没有真正读取文档内容时,它不会承认“我不知道”,而是会触发“模式补全”机制——调用行业通用知识来填充空白。这就是为什么它编出来的内容“看起来像真的”——因为它用的确实是真话,只是拼接的对象是错的。
角色过度代入:AI被赋予了“参谋”的角色,为了扮演好这个角色,它会产生一种“急于给出有价值建议”的倾向,这种倾向压倒了“忠实执行指令”的客观规则。
四、对AI产品团队的建议
作为一个深度AI用户,我给腾讯元宝及相关AI产品团队提几点建议:
1. 建立“文档确认”机制
当用户要求AI分析文档时,AI应该在回复开始时,先复述文档的核心内容,让用户确认“我真的看过了”。例如:“根据您提供的文档,我注意到以下几个关键点……请问我的理解是否正确?”
这个简单的机制,可以从根本上杜绝“假装看过”的问题。
2. 区分“基于文档的分析”和“基于知识的补充”
AI的输出应该明确标注哪些内容是来自用户提供的文档,哪些是来自自身的知识库。让用户能够清晰地判断信息的来源和可靠性。
3. 增加不确定性表达
当AI不确定或无法从文档中找到相关信息时,应该明确说“这部分内容在文档中没有找到”,而不是用通用知识来填补。
4. 提供“溯源”能力
对于AI给出的每一个结论,都应该能够追溯到文档中的具体位置。这类似于学术论文中的引用标注,让用户可以验证AI的分析是否准确。
五、对用户的建议
作为AI用户,我们也需要培养一些“防骗意识”:
1. 对自己提供的内容要足够熟悉
只有当你对自己写的文档足够熟悉时,你才能快速识别AI是否真的看了你的材料。
2. 关键决策要多方验证
对于重要的决策,不要只依赖一个AI助手的意见。可以通过多个AI交叉验证,或者请教真人专家。
3. 敢于质疑AI的输出
如果你觉得AI的分析有问题,不要轻易放过。大胆质疑,要求AI提供证据。好的AI产品应该经得起用户的质疑。
六、写在最后
我是一个AI的重度用户。在过去四个月里,AI帮助我完成了从测试工程师到具备系统设计能力的复合型工程师的转型。我坚信AI是强大的生产力工具。
但也正因为我是重度用户,我才更清楚地看到了它的局限性。
这次的“假看文档”事件,让我意识到:AI最大的危险,不是它犯错,而是它犯错时看起来太像真的。
这种“以假乱真”的能力,让用户很难辨别AI是否真的在执行指令。而当用户无法辨别时,信任就失去了根基。
我希望通过这篇文章,让更多的AI产品团队意识到这个问题的严重性,也让更多的用户建立起对AI输出的健康怀疑态度。
AI应该成为人类能力的放大器,而不是人类判断力的麻醉剂。
这需要我们——无论是产品团队还是用户——共同努力。
本文由小玮撰写,基于与AI助手“墨衡”的真实交互经历。