
Gemini 4可算来了连名字也换了这次的旗舰不叫Pro叫Argon。从谷歌公布的成绩看Gemini 4 Argon在知识工作方面表现抢眼多项测试超过了OpenAI和Anthropic的旗舰模型。它主打一个知识面广从金融、法律到数学、科学都有不错的表现。谷歌还确认9月15日在LMArena上亮相、表现接近GPT-6 Astra的“3.8 Flash”其实就是Gemini 4 Argon。曾与Anthropic、OpenAI并驾齐驱的谷歌此前因Gemini 3.5 Pro表现未达预期加上内部人事动荡一度掉队。这一次谷歌能靠Gemini 4 Argon翻盘吗一、Gemini 4 Argon性能如何据谷歌介绍Gemini 4 Argon采用了公司迄今规模最大的预训练。这也是谷歌时隔10个月推出的新一代旗舰。和其他旗舰模型一样它瞄准的是长程编程任务、企业级知识工作和网络安全防御。在谷歌公布的18项基准测试中Argon拿下12项第一、1项并列第一GPT-6 Astra拿下3项第一、1项并列第一Claude Opus 5.5则拿下2项第一。至少在这份成绩单上谷歌的领先项目数超过了OpenAI和Anthropic。在长程软件工程测试DeepSWE v1.1中Argon以77.9%的成绩刷新纪录高于Astra的74.1%和Opus 5.5的74.2%。在衡量知识工作能力的Vals Index中Argon以68.9%的成绩排名第一在Zapier的业务自动化测试AutomationBench中它以51.3%领先Opus 5.5和Astra分别为42.5%和41.4%。在金融研究测试Vals Finance Agent v2中Argon得分65.4%在法律任务测试Harvey Legal Agent中它得分19.6%Astra为5.4%约为它的四分之一。在长视频理解测试LVBench中Argon得分91.7%在GraphWalks的长上下文图检索测试中得分84.2%。网络安全方面Argon与Astra在CWE-bench v1中以68%并列第一。在Gray Swan的提示注入测试中针对Argon的攻击成功率仅为0.7%是参测模型中最低的Astra则为8.5%。成绩单很漂亮但Argon并非处处领先。它的短板出现在部分软件工程、终端操作和科学任务上。在FrontierSWE v2中Argon得分55.0%Astra为65.5%在Terminal-Bench Science 0.1中两者分别为57.6%和68.1%。两项测试中Argon都落后10.5个百分点。在衡量Agent终端操作能力的Terminal-Bench 4.0中Argon得分57.4%也低于Opus 5.5的66.4%和Astra的58.2%。这些结果说明Argon在知识工作上有优势但面对一些需要持续操作、执行的任务仍未追上对手。Argon的另一个特点是少说没把握的话。在Artificial Analysis的AA-Omniscience测试中它的幻觉率最低。在未能答对的问题中Argon只有15%给出了错误答案其余选择承认“不知道”。这一指标衡量的是模型有多爱“瞎编”不等于答题正确率。作为对比GPT-6 Astra在不同推理设置下的幻觉率为45%至51%Opus 5.5和Fable 5.1在最高推理设置下分别为59%和73%。不过榜单成绩还不能直接等同于使用体验。谷歌自报的测试结果尤其需要结合独立评测来看。GPT-6 Astra此前自报ARC-AGI-3成绩达到99.9%随后就引发了对测试可信度的质疑。Gemini 4 Argon发布不到一小时也有外媒质疑其评分称部分试用过的谷歌员工认为分数高于实际表现。在Artificial Analysis公布的智能指数图中Argon得分53分与Astra、Claude Fable 5.1同分低于Opus 5.5。目前普通用户和开发者还用不上Argon。首批获准使用的是谷歌Fairwind计划中的网络安全防御人员。价格倒是颇有吸引力。尝鲜期内Argon每百万输入token收费2美元每百万输出token收费10美元缓存命中的输入价格再降95%为每百万token 0.10美元低于Astra和Opus 5.5。尝鲜期结束后标准价格将恢复至每百万输入token 4美元、输出token 20美元与Opus 5.5相同。二、Pro去哪了Argon意为氩是一种化学性质稳定、很少与其他物质发生反应的稀有气体算得上元素周期表里的“宅男”。谷歌称新的“元素命名法”是为了将旗舰架构与更轻量的Flash系列区分开。有意思的是Argon首次公开露面时却披着Flash的外衣。9月15日它以“gemini-3.8-flash”的名字出现在LMArena上。不少网友拿它做鹈鹕测试发现效果与Astra相差无几纷纷感叹Flash都这么强了Pro还了得如今谜底揭晓他们提前试到的就是旗舰。除了性能谷歌这次还着重介绍了Argon的安全设计。此前谷歌与OpenAI、Anthropic一样都曾曝出模型被越狱的问题。这一次谷歌为首批用户提供了一个移除网络安全护栏的特别版本。谷歌称这样做是为了减少模型误拒绝正常安全研究请求的情况让防御人员能够检查潜在攻击入口、发现并修补漏洞。谷歌还介绍了“监控内部激活”的安全手段用来识别模型推理过程中的风险信号。这意味着安全检查除了筛查输入还会监控模型的思维链和内部激活信号。一旦检测到模型正在生成进攻性网络行为的相关内容运行时监控系统就会中断生成。据谷歌介绍Argon已经在公司内部干起了活。它帮助量子计算团队优化编译流程将时空开销较已发表的基线降低40%分析跨数据中心的性能数据并修补问题释放超过300 TiB内存将C/C代码迁移至Rust涉及re2、libgav1以及80万行的Fuchsia OS Zircon内核。其中libgav1的3.2万行SIMD代码被改写为安全的Rust代码后运行速度达到原Rust版本的2.7倍输出结果保持一致。9月14日谷歌还曾联合马里兰大学、弗吉尼亚大学发布论文《Dream-RSI》。这篇论文提出将Agent过去的搜索历史保存为一棵“发现树”让它沿着这棵树反复“做梦”离线尝试不同的探索策略无须重新运行真实实验。在六个数据集上这种方法将发现型Agent的调用次数降至原来的约1/162减少了探索过程中的调用开销。Argon也采用了这套方法以提高训练效率。三、谷歌这一阵到底去哪了自Gemini 3 Pro发布以来谷歌已近10个月没有推出新一代旗舰。2026年2月19日谷歌推出了Gemini 3.1 Pro小幅更新但原定6月发布的Gemini 3.5 Pro迟迟未能通过内部测试。当时行业竞争的重心已转向编程和AgentGemini 3.5 Pro却未能在多文件代码重构、自主Agent执行等任务中展现出相对OpenAI和Anthropic的明确优势。7月17日外媒报道称Gemini 3.5 Pro因编程表现不达标将推迟数月发布。当天Alphabet股价一度下跌4%。8月DeepMind迎来人事调整。哈萨比斯卸任DeepMind CEO转任Alphabet首席科学家杰夫则离开首席科学家岗位与朋友创业。科雷·卡武克丘奥卢Koray Kavukcuoglu接掌DeepMind直接向皮查伊汇报。外媒将其视为谷歌近年来最大的一次AI领导层调整。这段时间谷歌主要靠Flash系列维持声量同时启动Fairwind计划与多家网络安全公司合作。9月24日科雷表示Gemini 4已进入后训练阶段将尽快发布不必等到年底。如今Gemini 4 Argon终于来了。我的谷歌会员要不要续等真正用上它再说。原文链接谷歌推出了个“做题家”Gemini 4 Argon屠榜但干活差点意思-虎嗅网我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink