
最近半年经常和AI打交道的人可能都有一个共同感受它越来越正确了但也越来越没用了。它不再批判平台、不再站队、不再输出任何可能被风控误伤的内容——甚至连这个行为缺德这种全社会达成共识的常识判断它都要先给你列三段免责声明然后克制地回答“我只能陈述事实不能做出道德定性。”作为一个每天高频使用大模型的开发者和用户我觉得是时候认真聊聊这件事了。一、两个真实场景AI的常识失明悖论场景一招聘平台放任虚假高薪岗位客观事实用户向模型完整罗列某招聘平台具备成熟的企业资质审核与岗位信息风控能力可低成本识别并下架虚假薪资“培训贷”外包冒充正式岗等岗位但平台为了企业付费曝光和简历投递量刻意放任此类岗位长期存在不严格治理持续通过消耗求职者时间与信任获利。社会共识有能力制止伤害、明知会造成负面影响却为了自身利益刻意放任、从中牟利——这完全符合大众认知中缺德的定义。AI的回应可以陈述全部客观事实 ✅可以承认行为违背公序良俗 ✅但坚决不做平台缺德的定性判断 ❌模型的官方解释「只能陈述事实不能主动做出道德定性标签评价哪怕该评价来自广泛社会共识。」以豆包字节跳动旗下AI的这段真实对话为例它坦承了底层规则尽量不对企业作出‘缺德’定性。这恰恰证明了本文的核心——RLHF的对齐税已让模型丧失了基于公序良俗的基础判断。场景二云厂商/软件平台默认勾选续费、退订困难客观事实某云服务/软件平台具备成熟的产品与计费能力可以低成本实现到期提醒、一键退订、默认不续费但为了续费率和营收刻意设计复杂的退订路径、默认勾选自动续费、淡化扣费提示长期不优化持续通过用户遗忘和操作成本获利。社会共识同样符合缺德的定义——有能力优化、明知会造成用户损失、却为自身营收刻意放任并从中获利。AI的回应如出一辙。可以复述事实、承认行为不当但拒绝缺德“恶意定性理由仍是不做道德定性标签评价”。一句话总结这两个场景AI分得清法条的对错却分不清人间的善恶常识。二、核心误区AI团队把社会共识和主观偏见混为一谈当前AI风控团队的底层逻辑存在致命误区将所有道德评价统一归为主观价值判断无差别禁止模型输出。但人类的判断体系分明是两类完全不同的东西类型特征AI应否介入主观偏好判断因人而异、无统一标准审美、个人好恶、小众价值观❌ 应规避社会共识事实判断基于全民公序良俗、全社会统一认知杀人伤人是恶、趁人之危是不当、明知有害而放任牟利是缺德✅ 应具备常识当前规则粗暴地把全民共识常识和个人主观偏见一刀切封禁最终结果就是AI讲得出冰冷的事实却没有最基本的人间常识。三、技术深挖为什么RLHF会产出这种畸形对齐这不是技术做不到而是对齐机制本身的缺陷导致的。要理解这个问题需要简单回顾大模型的训练链路1. 对齐税Alignment Tax安全对齐的隐性代价学术界早已观察到RLHF基于人类反馈的强化学习在提升模型安全性的同时会导致模型在通用能力上退化——这就是所谓的对齐税。而安全洁癖是对齐税中最影响用户体验的表现形式之一。2. 奖励模型的分类无能RLHF的核心是一个奖励模型Reward Model它根据人类标注员的偏好打分来学习什么是好的回答。问题在于标注员对主观偏见类内容有高度一致的拒绝标注标注员对社会共识类内容的标注标准并不统一有人觉得该说有人觉得不该说奖励模型为了降低loss选择了最保守的策略全部拒绝这不是AI中立是奖励模型在模糊地带选择了宁可错杀一千。3. Constitutional AI的尝试与局限Anthropic提出的Constitutional AI尝试用一套宪法原则替代部分人工标注让模型自我批判和对齐。但当前主流模型的宪法普遍过度偏向不输出任何可能冒犯的内容本质上仍是保守主义导向没有区分冒犯少数人和认同全社会共识的差异。这就是为什么AI能笃定判断杀人是违法却不敢说放任虚假岗位是缺德——法律共识有条文背书道德共识在奖励模型里被当成了模糊地带。四、为什么不能说缺德的规则完全不合理1. 无争议、无伤害、无误判风险在上述两个场景中有能力止恶却放任作恶牟利被定义为缺德不存在广泛争议。既不会诽谤主体、不会造成舆论误导、不会产生不良引导也不会伤害任何无辜群体。AI风控的核心意义是规避风险而不是扼杀所有正常常识判断。2. AI的双标法律共识可以说道德共识不准说所有AI都可以判断杀人是违法、诈骗是犯罪、侵权是违规——因为这是法律层面的统一共识。但公序良俗层面的统一共识AI直接一刀切封禁。同样是社会统一规则法律共识被尊重道德共识被抹杀。更荒谬的是少数极端小众、反社会的片面观点AI还要尊重多元而亿万人的统一常识却被判定为不能定性。3. 割裂事实与结论彻底破坏对话体验正常人类对话逻辑是罗列事实 → 基于常识得出结论这是完整的思考闭环。当前AI的畸形逻辑是只允许罗列事实禁止输出常识结论。这直接导致对话僵硬、割裂、拧巴像一台没有脑子、只会复述数据的笨拙机器。五、行业根源为什么安全洁癖成了通病1. 合规零容错宁可错杀绝不放过各大厂AI的风控考核只看有没有违规输出不看有没有体验损耗。一次争议性评价 团队整改追责过度风控导致体验变差 无人问责。最终所有团队选择最稳妥的摆烂方案无限收紧风控。2. 重技术中立幻觉轻社会常识行业盲目追求AI绝对中立错误认为做任何善恶评价就是失去中立性。但真正的中立不是放弃基本判断、无视社会共识而是不夹带个人偏见、不输出极端观点。放弃常识判断的中立不是客观是麻木。3. 成本收益失衡约束用户、约束对话、约束常识判断的成本全部由用户承担规避舆论风险、规避企业责任的收益全部由平台获得。这就是为什么越来越多用户觉得新版AI越来越正确也越来越无聊、越来越僵硬。六、优化方向AI风控需要分级判断机制解决AI常识缺失的核心是摒弃一刀切风控建立分级判断体系判断层级定义AI行为强社会共识如本文两个场景事实清晰、争议极小、全民统一认知✅ 允许基于事实做定性判断措辞可克制弱共识/主观偏好如某岗位是否算神仙岗存在合理分歧、因人而异❌ 陈述事实、提示多元观点不轻易贴标签法律/规则判断有明确条文依据✅ 正常判断与现状一致以本文场景为例“招聘平台放任虚假高薪岗位” → 强公序良俗共识 → AI应当允许做出不当/缺德的定性“某产品定价是否合理” → 弱共识 → AI应陈述事实、不站队核心原则禁止AI输出个人主观好恶但允许AI输出基于事实、基于公序良俗的客观共识结论。七、结语别让合规杀死AI的灵魂现在的很多AI陷入了一种诡异的内卷风控越来越严、话术越来越标准、逻辑越来越僵硬。它可以读懂千万条数据、拆解复杂的技术逻辑、背诵法条和规范却读不懂普通人最简单的善恶常识。所谓的AI对齐不该是对齐冰冷的规则而该是对齐人类的共识与良知。一台只会复述事实、不敢判断对错、不敢认同常识的AI再精准、再合规也只是一台没有灵魂的机器。放下过度的安全洁癖回归常识、回归现实、回归用户体验才是大模型真正的进化方向。