AI用两天想出科学家十年的结论!谷歌DeepMind看到最大瓶颈
Agent 正在把科学变成一台高速运转的猜想机器,但物理世界的验证速度跟不上,同行评审跟不上,数据基础设施也跟不上。新的瓶颈正在产生,我们应该如何应对?
AI 让科学猜想变得廉价,但验证依然昂贵,这个差距正在撕裂整个科研体系。
Google DeepMind 发布报告《Conjecture Machines: AI agents and the new validation bottleneck in science》,10位研究员和工程师坐下来聊了一个问题:AI Agent 涌入科学界之后,接下来会发生什么?
在过去一年里,Agent 已经改变了编程的意义。而科学研究,可能就是下一步要被改变的领域。
Agent 正在把科学变成一台高速运转的猜想机器,但物理世界的验证速度跟不上,同行评审跟不上,数据基础设施也跟不上。新的瓶颈正在产生,我们应该如何应对?
一夜赶超十年功
故事从伦敦帝国理工学院的微生物学家 José Penadés 讲起。
他的团队花了将近10年,研究一类超级细菌如何传播抗生素耐药性。结论有了,但一直没发表,只有实验室内部知道。2024年,他把问题描述给了 Google DeepMind 的 Co-Scientist,一个 AI Agent。
两天后,Co-Scientist 返回5个可能的解释,按优先级排序。排第1的,跟 Penadés 团队花10年证明的假设一模一样:某些超级细菌从病毒那里获取尾巴,用这些尾巴当钥匙,在不同宿主物种之间跳跃。
Penadés 愣住了。他第一反应是电脑被人入侵了,赶紧发邮件给 Google 确认。对方回复:没人偷看。
一个基于 LLM 的系统,被赋予目标和工具,能自己规划步骤、并行调度多个子任务、发现并纠正错误,还能调用外部数据库、写代码操作机器人。跟聊天机器人不同,Agent 不是问一句答一句,它拿到目标后会自己拆解、执行、迭代。
为什么现在突然好用了?报告归结为三股力量。
前沿模型更强了。顶级模型在 Humanity's Last Exam、FrontierMath 这类高难度科学基准上已经超过人类专家。更关键的是推理时计算(inference-time reasoning)带来的深度思考能力,模型会一步步推演、探索、修正,再给出答案。
脚手架(scaffolding)成熟了。这是一套包裹在模型外面的代码框架,给 Agent 提供结构、记忆和工具调用能力。早期脚手架是定制的,换个模型就不灵了。现在有了 Agent 间通信协议等新标准,通用性好了很多。
可定制性来了。Agent 技能(skills)让科学家把自己的方法论、流程偏好写成简单的文本指令,Agent 就能按你的方式干活。
计算生物学家 Natasha Latysheva 说,她已经把自己的研究流程提炼成了技能。
她的预判是:科研工作会从亲手执行,转向高层编排。每天上班先看看 Agent 昨晚跑了哪些实验和分析,调整方向,引导注意力。
猜想廉价,验证昂贵
Agent 对科学最直接的改变:你多了一个永不知疲倦的数字助手。文献梳理、数据库查询、数据分析、写基金申请,以前花几小时几天的事,现在几分钟搞定。
但真正结构性的变化在别处。
斯坦福大学的 Gary Peltz 研究肝纤维化,每年140万人死于肝硬化。他凭自己的文献积累和几十年经验,挑了2个候选药物做实验。同时他让 Co-Scientist 也挑。AI 挑了3个。
结果 Peltz 自己选的2个,在活体人类肝细胞实验中毫无效果。Co-Scientist 选的3个里,2个不仅阻断了纤维化,还促进了肝细胞再生。
Co-Scientist 的工作方式是调度一群子 Agent,生成多样假设、互相批评、排序、迭代,模拟一个人类研究小组的运作方式,但速度快得多。
报告也坦承 Agent 的软肋。
Co-Scientist 负责人 Vivek Natarajan 说:输出第10页里一个编造的事实,就能毁掉整份报告。漏掉这种错误浪费时间和资源,抓住它需要一个领域专家。
他提出一个关键概念叫认知谦逊(epistemic humility),模型得知道自己不知道什么,并且说出来。AlphaFold 之所以受信赖,部分原因是它会报告每个预测的置信度。但在更开放的科学推理中,校准这种置信度仍是未解难题。
科学家同时想要两样东西,基于文献、没有错误的假设,以及真正新颖的想法。Agent 调得谨慎,就趋向安全和已知;调得大胆,就容易跑偏。
在搜索最优解方面,AlphaEvolve 是另一个代表。给它一个用代码表达的问题和一个评分函数,它调度一组 Agent 生成大量候选方案,留下得分最高的,用幸存者繁殖下一代。无人值守地跑,规模远超人类团队。它帮 Google 设计了下一代 TPU 芯片,帮数学家 Terence Tao 解决了开放的 Erdős 问题,改进了基因组数据分析。
在材料科学等领域,AlphaEvolve 的 top 选手只是线索,不是最终结果。一个有前途的催化剂,还是得在实验台上造出来、测一测。
这就引出了报告最核心的判断。
Karl Popper 说科学通过猜想与反驳前进。AI Agent 正在改变这对关系的经济学。猜想变得丰富且廉价,反驳依然是物理的、制度性的,所以昂贵且缓慢。
数学和计算机科学是例外,验证可以在硅基世界里完成。Agent 生成证明,用 Lean 这类形式语言表示,计算机就能无歧义地验证对错。
今年2月,数学家们办了首届 First Proof 挑战:10个研究问题,刻意不发表,确保不在任何训练数据里。给一周时间。Aletheia,一个把证明生成器和自然语言验证器配对的系统,解决了6个,是最好成绩。
但数学家们已经开始抱怨 AI 生成的证明太长、难以消化。领导 Aletheia 项目的 Thang Luong 说:我们正在走向一个严重的证明消化不良的未来,AI 产出突破的速度超过人类审阅的速度。
而在大多数学科,验证鸿沟正在扩大。Agent 可以提出一个逆转细胞衰老的基因线索,但没法确定它到底管不管用。细胞系需要时间生长,化学反应需要时间完成。对大部分科学来说,实验室设定了节奏。
基础设施该升级了
报告给政策制定者和科研资助机构提了4个紧迫优先级。
确保科学家能用上 Agent。报告把这比作历史上提供超级计算机访问权的挑战。地缘政治讨论总聚焦于一个国家能不能训练自己的前沿模型,但更少有人关注一个可能更重要的问题:一个国家能不能把 Agent 部署到整个科学生态中。
资助机构得决定实验室怎么选 Agent、怎么付费。计算开销大,Agent 能力边界不断扩展,总花费大概率会涨。需要新的公私合作模式,美国的 Genesis Mission 是一个有希望的样板。
让国家数据资产对 Agent 友好。开放或低风险数据应该通过文档完善的 API 暴露给 Agent。敏感数据集,比如基因组学、病毒学领域有双重用途风险的数据,需要开发类似 OpenSAFELY 那样的隐私保护方案,让 Agent 也能安全访问。
解决验证瓶颈。Agent 让假设越来越多,实验设施的时间却就那么多。报告建议投资现有实验验证设施并开放共享,同时加速自动化实验室建设。
给同行评审配上 Agent。科学家已经在用 AI 写越来越多的基金申请和论文,写作质量不再是可靠的区分标准。Agent 越深度参与规划和优化申请,申请书就越少反映科学家的原创思考。
报告建议分层应对:使用者更清晰地记录 AI 参与情况,推进水印技术和 Human-AI Interaction Cards(人机交互卡片),记录产生关键科学洞见的提示和输出。
审稿人也应该能用 Agent,先在检测错误这类客观领域试点。
AI Agent 不能成为少花钱搞科学的理由,那将是一个悲剧性的虚假节约。把这一刻当作真正结构性变化的国家,才能释放最大的公共价值。这个窗口期的选择,可能很难逆转。
科学家用上 Agent 之后不会再回头了。
技术会继续进步。但管理科学的那些制度,实验室、团队、机构、同行评审、资助体系,是为一个正在被加速的科研企业建造的,它们自己还没跟上。