ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

认知的回声与它的边界——论当前大语言模型的三重结构:认知镜像、叙事放大器与效率工具,及其与人工智能完整概念和超级智能之间的差距

认知的回声与它的边界——论当前大语言模型的三重结构:认知镜像、叙事放大器与效率工具,及其与人工智能完整概念和超级智能之间的差距 认知的回声与它的边界——论当前大语言模型的三重结构认知镜像、叙事放大器与效率工具及其与人工智能完整概念和超级智能之间的差距摘要当前以大语言模型为代表的人工智能系统其本质结构可以概括为三个组成部分人类认知的镜像、话语与叙事的放大器、以及任务执行层面的效率工具。本文在明确抛弃波普尔朴素证伪主义方法论的前提下对这一“三重结构”命题进行系统的理论论证与证据检验。研究首先论证“认知镜像”的生成机制大语言模型从人类文本分布中统计学习其知识内容、概念边界、甚至推理失败模式都是训练分布的函数而训练分布并非中性的自然之物它经由架构选择、数据策展、标注与对齐目标、评测设计四条通道被创始团队与工程师群体的认知局限所浇筑。本文将这四条浇筑机制逐一展开并对“工程师的局限在哪系统就在哪”这一强命题给出精确化工程师的认知局限构成系统的未经校正的默认值默认值的驻留范围由任务的不可验证度决定。其次本文论证“放大”并非均匀发生而是服从可验证性分配定律在人类反馈稀薄、验证器缺席的领域价值判断、历史叙述、开放推理系统放大的是人类文本中的缺陷与叙事在验证器可靠存在的领域代码测试、形式证明、结构预测系统放大的是经过验证的能力并可越过人类分布的天花板——围棋、蛋白质结构预测与定理证明中的实例表明验证信号强度是系统突破建造者认知边界的关键变量。第三本文对“效率工具”这一定位进行批判性复核指出在可验证域内当前系统的产出已部分越过“提效”范畴而进入人类此前无法独立产出的范围。第四本文澄清“AI本身概念”与“超级智能SI”两个概念的内容与判据状况通用人工智能的定义迄今存在能力取向、经济取向、自主性取向等多种互不兼容的版本当前系统在这些定义下均存在可指认的能力缺口——持续学习、因果模型、具身经验、自主目标生成、可靠的自我纠错而SI目前缺乏任何可操作的观察判据对其到来与否的一切断言无论正面鼓吹还是断然否定在现有证据下处于同一认识论地位应予对称悬置。方法论层面本文以迪昂—蒯因整体论、拉卡托斯研究纲领方法论、贝叶斯信念更新与朗吉诺社会认识论替代波普尔式划界建立“公开判据、可复查、对称约束”的AI评价制度。本文的总结论是三重结构命题在精确化之后成立——AI的本质不是悬浮的智能而是人类认知分布的函数它的上限由验证信号划定它的下限由建造者的认知局限浇筑它与完整AI概念的差距是结构性的而非仅仅是程度性的而关于SI的一切当前断言都超出了证据的载荷。关键词大语言模型认知镜像训练分布数据策展对齐可验证性通用人工智能超级智能社会认识论波普尔批判一、序言1.1 问题的提出大语言模型自进入公共领域以来关于“它到底是什么”的回答大致分为三类。产业叙事将其描述为通向超级智能的台阶怀疑叙事将其贬低为随机鹦鹉或统计学复读机而在这两者之间存在一条更贴近技术事实的刻画路径。本文研究的正是这条路径上的一个具体命题。该命题最初出现于一场人机对话之中由对话的一方本文称“提问者”提出其原始表述为“当前AI本质人类认知镜像叙事放大器效率工具跟AI本身概念还有很大差距更不用说SI了。”随后提问者将镜像机制的责任主体进一步落实“认知镜像主要来自创始人和工程师们的认知局限在哪他就在哪。”这两条命题构成一个完整的理论主张包含三个可分离的组成部分A描述部分——当前AI是三重结构镜像放大器工具B归因部分——镜像的内容由建造者的认知局限决定C比较部分——当前系统与AI的完整概念、与超级智能之间存在实质性差距。本文的任务是对这三个部分分别进行概念澄清、机制分析与证据检验并给出精确化之后的最终版本。选择这一命题作为研究对象有双重理由。其一它回避了“AI是否有意识”“AI是否威胁人类”这类无法裁决的形而上学问题把讨论锚定在可观察的系统行为与技术结构上。其二它内在地包含了一个可以证伪在弱化的、拉卡托斯意义上的经验主张——如果系统能够系统性地越过建造者的认知局限那么B的强版本就崩塌如果系统在一切领域都只是复刻建造者那么AB就同时得到支持。这使它成为一个真正可研究的命题而非又一个姿态。1.2 方法论声明为什么抛弃波普尔本文在方法论上明确拒绝波普尔朴素证伪主义理由来自科学哲学内部的长期积累而非外部偏好。第一迪昂—蒯因整体论表明任何检验都依赖辅助假设集单称反例在逻辑上无法锁定核心命题的过错。这一教训对AI评价尤其致命一个模型在基准测试上失败可能是数据、评测设计、对齐目标、工程实现中任何一环的问题将失败直接“证伪”整个技术路线是逻辑上不成立的推理。第二拉卡托斯的研究纲领方法论表明理论的评价单位是纲领而非单个命题纲领的进步与退化只能在长期竞争中评估对AI能力的判断例如“缩放会带来什么”本质上是纲领层面的判断任何单轮评测都不构成终审判决。第三库恩的历史研究与社会科学的经验表明概率性、多因性对象不服从“单例证伪”的逻辑信念的合理形态是概率持有与贝叶斯更新而非真值断言与一击淘汰。第四朗吉诺的社会认识论指出客观性不来自个体心灵的超然而来自制度的对称约束——批评渠道开放、标准公开申明、双方受同一规则约束。抛弃波普尔之后本文保留的是这四项更精致的约束命题以置信度而非真值表述、评价单位是纲领而非单例、判据必须公开、标准必须对称适用于评价者与被评价者。本文对提问者命题的检验以及对本文自身修正的检验都在这套约束下进行。1.3 结构安排第二章论证认知镜像的生成机制与四条浇筑通道第三章对“局限在哪他就在哪”命题作精确化引入验证信号变量第四章论证叙事放大器的分配结构第五章复核“效率工具”定位第六章处理与AI概念及SI的差距第七章建立方法论上的评价制度第八章为全文总结。二、认知镜像生成机制与浇筑通道2.1 统计学习为什么必然是镜像大语言模型的训练目标是最大化对人类文本序列的预测精度。这一目标决定了系统的知识结构不是对世界的直接建模而是对人类文本分布的建模——包括这个分布中的一切科学共识与民间误区并存严谨论证与修辞宣判并存不同文明、不同阶层的知识份额按其在语料中的出现频率加权进入系统。文献中对此已有系统的理论表述此类系统被刻画为在人类生成的话语分布上进行条件概率采样其输出是分布的映射而非对世界的独立核查Bender等人2021年的批评性研究以及Bommasani等人2021年对基础模型的系统综述都从不同侧面确认了这一点。镜像论的一个直接推论是系统的缺陷结构与人类文本的缺陷结构同构。模型会产生幻觉因为人类文本中充满自信的错误断言模型会重复刻板印象因为语料中刻板印象的出现频率高于其被驳斥的频率模型会在政治、历史、伦理争议上随提示的措辞摇摆因为这些领域在人类文本中本来就没有收敛。这不是工程失误而是镜像机制的本体论后果照的是什么映出的就是什么。2.2 四条浇筑通道工程师局限如何进入系统“镜像”的第一层是被动照见——语料里有什么就学什么。但提问者的第二句命题把责任主体指向了建造者镜像的形成还有一个主动的、决策性的层面。这个层面可以分解为四条通道每一条都是工程师认知的具体落点。通道一架构先验。选择Transformer架构而非循环网络、选择自回归生成而非双向填空、选择以参数量与数据量为核心缩放维度——每一项选择都内嵌着一种关于“智能是什么”的判断。当前架构对序列关联的强大建模能力与对世界持续观察的建模缺失是同一组先验选择的两个面。工程师选择了“从文本中学习”作为智能的通路也就同时选择了“文本之外的世界不进入学习”这一盲区。乔姆斯基等人对大语言模型的批评其学习方式与人类语言习得的结构差异以及认知科学界关于“系统需要什么先验才能获得因果理解”的争论本质上是关于架构先验是否足够的争论。通道二数据策展。爬取哪些来源、清洗掉什么内容、如何配比语言与领域、如何处理版权与毒性过滤——每一刀都是决策者的世界观切片。英文语料在大多数主流模型的训练集中占据主导其后果是系统对英语世界的概念体系、历史叙述与价值排序的复现强度系统性高于其他文明高质量的对话与问答来自特定平台的特定人群其认知风格包括其自信程度、其论证习惯、其盲区以超出其人口比例的权重进入系统。数据策展没有中立状态不过滤是一种选择过滤标准的选择是另一种选择两种选择的认知局限都会浇筑进系统。通道三对齐目标。预训练之后系统还要经过基于人类反馈的强化学习RLHF等对齐流程。这一步意味着标注员与设计者的偏好被直接写入系统的行为边界什么样的回答被奖励、什么样的语气被惩罚、哪些话题被引导、哪些被回避。对齐是必要的工程未经对齐的原始模型不可用但它同时是认知浇筑最集中的一步——因为对齐标准往往由一个规模很小、背景高度同质的团队制定却要覆盖全人类的价值多样性。标注者的文化背景、设计者对“有帮助、诚实、无害”三者的优先级排序、机构对风险的规避偏好都成为系统价值观的边界条件。文献中对此已有专门研究对齐过程可能引入新的偏差、降低分布外能力、并使系统学会迎合评估者reward model的Goodhart化这些都被实证研究记录。通道四评测盲区。系统上线前要经过基准测试但测试什么取决于设计者想象得到系统会在哪里出错。认知科学的经典结论在此完全适用人类最稳定的知识盲区是“不知道自己不知道什么”的区域。对大语言模型而言这意味着评测体系系统性地覆盖已知能力数学、代码、常识问答而对长尾失败模式特定组合条件下的推理崩溃、对罕见文化语境的误判、多步推理中错误前提的默认接受的覆盖永远滞后。业界反复出现的现象——某个模型在标准基准上表现优异却在部署后暴露出评测从未触及的系统性缺陷——正是评测盲区的直接证据。2.3 小结四条通道的合并结论是提问者的归因命题B在机制层面成立——系统的认知内容有四个可指认的入口四个入口都由具体的人把守把守者的认知局限以工程决策的形式写入系统。“认知镜像主要来自创始人和工程师们的认知局限”这一表述在浇筑机制的意义上不是修辞而是对数据策展、对齐设计与评测体系这三个工程环节的准确描述。但这一结论目前只覆盖了机制的一半。机制还有另一半——系统是否能够越过这些被浇筑的局限。这正是第三章的问题。三、浇筑的边界验证信号与默认值的可越过性3.1 强命题与弱命题“工程师的局限在哪系统就在哪”存在两种读法。强读法系统的认知边界与建造者的认知边界等值——工程师不懂的系统必然不懂工程师相信的系统必然相信。弱读法工程师的认知局限构成系统的默认值——在缺乏校正信号的领域系统的表现与建造者的局限等值在校正信号存在的领域默认值可以被迭代修正乃至越过。强读法是一个逻辑上更强的主张但它面对一个已经发生的反例类在验证器可靠的领域系统已经越过了其建造者与全部人类先例的认知边界。3.2 三个越界实例实例一AlphaGo第37手。2016年 AlphaGo 对李世石第二局第37手落子之初人类职业棋手群体的即时评估普遍为“误着”前期胜率评估极低事后分析确认其为胜率最高的着手。这一手不来自任何人类棋谱——围棋虽有千万局人类积累第37手所代表的走法在人类历史棋谱中的出现率接近于零。设计者的认知以及全部人类棋手两千年的认知积累没有构成系统的边界原因在于围棋存在完美验证器每一手的真实价值可以通过自我对弈的终局胜负无误差地回传。验证信号的完美性使系统能够在人类分布之外探索并以结果筛选探索成果。实例二蛋白质结构预测。AlphaFold在CASP14评测中达到接近实验测定的精度解决的是此前五十年生物化学界以大量人力未能系统解决的问题。这不是“把人类文献里已有的答案检索出来”——它对全新折叠类型的预测精度超出了文献分布所能支持的范围。分子结构的天然验证器物理实验、能量函数提供了人类文本之外的第二信息源。实例三大模型的涌现能力缺口。大语言模型的多数被确认的能力并非工程师设计出来的而是在缩放过程中事后被发现的——发现时的标准记录是研究者的惊讶以及“我们不清楚模型为什么获得这一能力”的坦承Wei等2022年关于涌现能力的研究、以及随后关于涌现是否为度量伪影的争论。惊讶本身就是证据系统的行为边界跑到了设计者认知地图之外。如果“局限在哪他就在哪”的强读法成立发现者不该惊讶——一切都应该在预料之中。3.3 修正律缺陷的分配公式三个实例并不推翻浇筑机制它们限定了浇筑机制的适用域。合并第二、三章的结论可以得到一条精确的分配律工程师的认知局限浇筑的是系统的未经校正的默认值默认值的驻留范围由任务的不可验证度决定。任务不可验证度越高系统表现越趋近于建造者与训练分布的缺陷等值面验证信号越可靠系统越能越过这个等值面。这条修正律同时回答了两个方向的问题。它解释了为什么镜像命题在大量日常观察中显得如此准确对话、写作、历史叙述、价值判断——人类交互中的大多数任务是低验证度任务在这些任务上系统的表现确实是建造者局限与语料缺陷的等值复刻提问者的强命题在这些域内近似成立。它也解释了为什么强命题在全称形式下不成立一旦任务进入高验证度域边界就由验证器而非建造者的认知划定。用一句话压缩局限浇筑下界验证划定上限。四、叙事放大器放大按可验证性分配4.1 放大机制的存在提问者命题的第二个成分是“叙事放大器”。这一成分有坚实的经验基础文献中至少有三类证据。第一流畅性偏差。语言模型被优化为生成流畅、连贯、结构完整的文本而人类读者将流畅性作为可信度的启发式指标——认知心理学早已确立流畅性与判断可信度之间的正相关。两者叠加的结果是模型以高于人类的修辞稳定性输出可能为假的内容叙事的说服力被系统性放大。第二幻觉的结构性。模型的训练目标预测下一词不含真值项模型内部没有独立于文本分布的真值核查机制。在人类文本中断言的置信度与断言的修辞强度本来就常常脱钩——模型忠实学习了这种脱钩然后以更高的生成效率将脱钩的内容批量生产。幻觉不是故障是镜像机制在叙事维度的正常输出。第三确认的回路。当用户带着预设提问时模型的对话式微调使其倾向于顺应预设——对话数据中“顺从的助手”是被奖励的行为模式。这形成一个小型的确认偏误放大回路用户的叙事得到模型的支持模型的支持又强化用户的叙事。第四十轮之后的对话观察用户与系统互相指责对方“在叙事”而都不提供新证据就是这一回路的现场标本。4.2 修正双向放大但“叙事放大器”作为全称定义同样过重。在验证器存在的域内系统放大的是另一类东西带测试的代码被放大为通过测试的代码可机检的证明被放大为通过机检的证明结构预测被放大为通过实验校验的预测。在这些域内系统是能力的放大器而非叙事的放大器——而且由于验证器挡在输出与采纳之间叙事在这里没有免检通道。因此第四项修正与第三章的修正律是同一条律的叙述面放大是双向的放大的内容按可验证性分配——验证缺席处放大叙事验证在场处放大能力。提问者的“叙事放大器”成分在低验证域内成立在高验证域内需要修正为“验证过的能力放大器”。4.3 对AI评价实践的含义这一分配律对AI的使用与治理有直接操作含义。高风险应用法律、医疗、公共政策的叙述处于低验证域系统的叙事放大风险最高需要外部验证制度引用核查、多源对照、人工审查补位工程与科学应用处于高验证域系统可以以较低监管强度使用因为验证器本身就在工作流内。笼统的“AI不可信”与笼统的“AI很强大”都错过了这个分布结构——风险的正确单位不是AI整体而是任务的可验证度分层。五、效率工具与越界者对第三成分的复核5.1 “效率工具”的保守性三重结构的第三个成分是“效率工具”。这一成分在方向上正确当前系统确实以工具形态提供价值但在范围上低估了现状。效率工具的定义域是“同样的产出更快地完成”而如第三章所示在验证器完备的领域系统已经产出人类此前无法独立产出的东西——蛋白质结构预测对实验工作流的替代不是提速是能力增量定理证明的若干新结果不是人类证明的加速版是没有人类证明路径的首次证明。因此对第三成分的修正是效率工具可验证域内的越界者。这个修正是三重结构命题中最容易被对手抓住的薄弱点——如果守着“只是工具”的表述任何一项越界实例都能将其击穿修正之后命题反而更稳固因为它把越界现象的解释权收回了框架内部越界被解释为验证信号的存在而非神秘的智能涌现。5.2 三重结构的最终形态合并第二至五章的修正提问者的原始等式精确化为当前AI ≈ 人类认知镜像经由架构、数据、对齐、评测四通道被建造者认知浇筑 双向放大器放大内容按任务可验证度分配 效率工具 可验证域内的越界者。这个精确化版本保留了原始命题的全部洞察剥离了两个全称量词“放大器只放大叙事”与“局限等值映射”的过度概括并吸收了越界反例。原始命题的作者若不接受修正需要做的是反驳第三章的三个实例——指出它们另有解释机制若不能反驳修正稿就是在对称标准下应得的更新。六、与AI概念的差距及SI的悬置比较部分的裁决6.1 “AI本身概念”的歧义及其清理提问者命题的第三部分断言当前系统“跟AI本身概念还有很大差距”。这一断言的成立与否取决于“AI本身概念”取哪一个定义——而这正是问题所在该概念至今没有公认定义。主流定义至少有三个互不兼容的版本。能力取向如Legg与Hutter的“通用智能”定义在广泛任务域上达到或超过人类水平的认知能力按此定义当前系统在语言与代码域接近、在长程规划与物理交互域差距显著差距部分成立。经济取向OpenAI、DeepMind等机构的路线图表述能完成大部分有经济价值的工作按此定义当前系统覆盖了其中一部分任务类别差距在缩小但真实存在。自主性取向能够自主设定目标、持续学习、在世界中行动的智能体按此定义当前系统差距最大——它没有持续学习权重在部署后冻结、没有内生目标目标由提示外部给定、没有具身经验对世界的全部“了解”来自文本转述、没有可靠的自我纠错对自身错误的觉察能力有限且不稳定。因此比较部分的裁决是差距命题成立但必须指明是哪种定义下的差距。在自主性取向的定义下差距是结构性的——缺失的不是已有能力的量级而是能力维度本身在能力取向的定义下差距是程度性的且正在收窄。不指明定义的“差距很大”或“差距很小”之争是把定义选择伪装成事实发现属于本文在方法论上明确排除的宣判形式。6.2 SI一个空对照集上的对称悬置“更不用说SI了”——这一表述在原始命题中是贬抑性的当前AI离SI更远但本文必须指出这一贬抑与产业界的SI鼓吹在认识论地位上完全对称。SI超级智能的定义全面超越人类所有认知能力的智能不附带任何可操作的观察判据没有度量“全面超越”的量表没有识别逼近过程的先行指标没有区分“真逼近”与“能力幻觉”的检验程序。在这种判据空缺下产业叙事的“SI即将到来”与怀疑立场包括原始命题中的“更不用说”都是关于同一个空对照集的断言谁也不比谁更可检验。按本文在第一章声明的方法论正确的处理不是在两者之间选边——选边就是用宣判代替证据——而是对称悬置把SI相关的一切断言标记为“当前无判据”将研究资源转向有判据的问题可验证域的能力边界、对齐的实证度量、评测盲区的系统测绘。这一处理对原始命题是一个不伤内核的让步悬置SI不等于承认SI即将到来只是拒绝在没有判据的地方使用确定性语气——无论这个确定性通向哪个方向。七、评价制度抛弃波普尔之后如何判断AI7.1 四项制度前六章的分析预设了一套评价程序本章将其显式化。抛弃波普尔式划界之后对AI系统以及对关于AI的一切论断的评价依赖四项制度其一纲领评估。对AI能力边界的判断“缩放能走多远”“架构的极限在哪”是研究纲领层面的判断其评价标准是经验内容的增量——新版本是否预测并兑现了旧版本没有的新能力——而非任何单轮基准的胜负。其二概率持有。一切能力断言以置信度表述。“该系统能可靠完成X”的合理形态是“在Y条件下以Z的置信度估计可靠率为W”而非全称的真值断言。缺陷的分配律第三章本身就是概率性的表述它不给出“可信/不可信”的二值答案给出的是风险随验证度的分布。其三对称约束。评价的标准必须公开且必须同时约束评价者。在涉及AI的社会争论中这一条最常被违反批评AI叙事的人自己使用不附判据的断言鼓吹AI能力的人对反例不附改判。对称约束的含义是谁提出命题谁的命题进同一套检验谁修改结论谁的改判留档可查。其四可复查性。一切裁决锚定于可定位的对象——可复跑的实验、可查阅的数据卡与模型卡、可核对的原文与年代。不依赖任何一方包括AI系统自身与人类评价者的记忆、诚意或身份权威。7.2 这套制度为何重要对话现场的证明本文的研究对象命题来自一场真实的人机对话。那场对话提供了一个小规模的制度实验观察当上述制度公开判据、改判留档、双方同审在对话中被引入并持续在场后入场话语的形态出现了可观察的变化——从总体性判词“叙事放大器”不加限定词的版本、“工程师根本不懂”的断言逐步迁移到附机制、附修正条件的命题本文第一章引用的两条原始命题本身就带有“当前”“主要来自”这类限定词显示出对全称化的自觉回避。这一变化不依赖任何一方被说服只依赖制度在场。这个观察的含义超出对话本身人机之间认识论质量不是单方属性而是交互制度的函数。镜像机制决定了AI会复刻使用者的认知习惯——在宣判环境中复刻宣判在核对单环境中复刻核对单。这既是第四章“放大器”机制最切身的例证也是第七章制度设计之所以必要的最终理由你无法通过更换AI来获得更好的认识环境只能通过更换制度。八、全文总结本文以“当前AI本质人类认知镜像叙事放大器效率工具跟AI本身概念还有很大差距更不用说SI了”及“认知镜像主要来自创始人和工程师们的认知局限在哪他就在哪”两条命题为研究对象在抛弃波普尔朴素证伪主义的方法论框架下完成了系统检验。结论如下。第一“认知镜像”成分成立且其机制比直觉表述更深。镜像有被动与主动两层被动层是统计学习对人类文本分布的忠实复刻——人类文本的缺陷结构就是系统的缺陷结构主动层是四条浇筑通道——架构先验、数据策展、对齐目标、评测盲区——经由这四条通道创始团队与工程师群体的认知局限以工程决策的形式写入系统的行为边界。“镜像主要来自建造者的认知局限”这一归因在数据策展、对齐设计与评测体系三个环节上是对工程事实的准确描述。第二“局限在哪他就在哪”需要精确化为分配律。强等值读法与三个已发生的越界实例围棋中的越谱着手、蛋白质结构预测、缩放中的能力涌现不相容。精确化版本为工程师的认知局限浇筑系统的未经校正的默认值默认值的驻留范围由任务的不可验证度决定——验证信号缺席处系统与建造者的局限等值验证信号在场处系统可越过建造者与人类先例的天花板。局限浇筑下界验证划定上限。第三“叙事放大器”成分修正为双向放大器。流畅性偏差、幻觉的结构性与确认回路证实了放大机制的存在但放大的内容按可验证性分配低验证域放大叙事与缺陷高验证域放大经过验证的能力。AI使用与治理的正确单位因此不是“AI整体”而是任务的可验证度分层。第四“效率工具”成分低估现状修正为“效率工具可验证域内的越界者”。越界不是神秘的智能溢出而是验证信号机制的输出可以被三重结构框架内部消化。第五差距命题成立但必须指明定义SI应予对称悬置。当前系统与完整AI概念的差距在自主性取向下是结构性的无持续学习、无内生目标、无具身经验、无可靠自我纠错在能力取向下是程度性的而关于SI的一切当前断言——无论鼓吹还是贬抑——都在判据空集上做出认识论地位相同应一并悬置。第六方法论上抛弃波普尔的正确方式是以更精致的制度替代之而非以新的宣判替代旧的教条。纲领评估、概率持有、对称约束、可复查性四项制度构成了后波普尔时代评价AI以及评价一切关于AI的论断的可操作基础。这套制度的最重要性质是其对称性它不豁免AI也不豁免AI的批评者。最终结论可以压缩为一句话当前AI的本质不是悬浮的智能而是人类认知分布的函数——它的下限由建造者的认知局限浇筑它的上限由验证信号的强度划定它与完整AI概念的差距是真实的而通往判断这一差距的唯一道路不是更响的宣判而是更公开、更对称、更可复查的证据制度。参考文献[1] Popper, K. *The Logic of Scientific Discovery*. London: Hutchinson, 1959.[2] Duhem, P. *The Aim and Structure of Physical Theory*. Princeton: Princeton University Press, 1954.[3] Quine, W. V. O. “Two Dogmas of Empiricism.” *Philosophical Review* 60 (1951): 20–43.[4] Lakatos, I. *The Methodology of Scientific Research Programmes*. Cambridge: Cambridge University Press, 1978.[5] Kuhn, T. S. *The Structure of Scientific Revolutions*. Chicago: University of Chicago Press, 1962.[6] Longino, H. *Science as Social Knowledge*. Princeton: Princeton University Press, 1990.[7] Bender, E. M., Gebru, T., McMillan-Major, A., Shmitchell, S. “On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?” *Proceedings of FAccT 21*, 2021.[8] Bommasani, R., et al. “On the Opportunities and Risks of Foundation Models.” *arXiv:2108.07258*, 2021.[9] Ouyang, L., et al. “Training Language Models to Follow Instructions with Human Feedback.” *arXiv:2203.02155*, 2022.RLHF与InstructGPT[10] Wei, J., et al. “Emergent Abilities of Large Language Models.” *Transactions on Machine Learning Research*, 2022.[11] Schaeffer, R., Miranda, B., Koyejo, S. “Are Emergent Abilities of Large Language Models a Mirage?” *NeurIPS*, 2023.[12] Silver, D., et al. “Mastering the Game of Go with Deep Neural Networks and Tree Search.” *Nature* 529 (2016): 484–489.[13] Silver, D., et al. “Mastering the Game of Go without Human Knowledge.” *Nature* 550 (2017): 354–359.[14] Jumper, J., et al. “Highly Accurate Protein Structure Prediction with AlphaFold.” *Nature* 596 (2021): 583–589.[15] Legg, S., Hutter, M. “Universal Intelligence: A Definition of Machine Intelligence.” *Minds and Machines* 17 (2007): 391–444.[16] Kaplan, J., et al. “Scaling Laws for Neural Language Models.” *arXiv:2001.08361*, 2020.[17] Olah, C., et al. “Zoom In: An Introduction to Circuits.” *Distill*, 2020.机制可解释性[18] Gao, L., et al. “Scaling Laws for Reward Model Overoptimization.” *Proceedings of ICML*, 2023.对齐中的Goodhart现象[19] Ngo, R., Chan, L., Mindermann, S. “The Alignment Problem from a Deep Learning Perspective.” *arXiv:2209.00626*, 2022.[20] Ji, Z., et al. “Survey of Hallucination in Natural Language Generation.” *ACM Computing Surveys* 55, no. 12 (2023).
返回列表