ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Gemini 4 Argon追平GPT-6 Astra,但还用不上

Gemini 4 Argon追平GPT-6 Astra,但还用不上 Google 沉寂了大半年终于发了新模型 Gemini 4 Argon。按 Artificial Analysis 的说法这是 Google 7 个多月来第一个高于 Flash 级别的专有模型。发布当天它就在 Arena 的文本榜拿了第一在 Artificial Analysis 的智能指数上追平了 GPT-6 Astra。但这个模型大多数人居然用不上。01 谁能用谁不能用先说最扎心的你大概率用不上。现在能用的是 Google 通过 Fairwind 计划挑出来的“可信测试者”。官方博客说得更具体是“可信的网络防御者”。Google AI Ultra 订阅用户和付费 API 客户排在后面。什么时候轮到官方只写了“尽快”没给日期。输出上限也从 64K 提到了 1M token。X 上有人回得很直接只给可信测试者用那我们不关心除非能自己测。02 Google 自己的成绩单成绩单是 Google 自己出的一张表对手是 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。![▲ 图官方基准对比表Google我数了一下一共 19 项13 项 Argon 单独第一1 项并列5 项落后。赢的地方主要是知识工作和智能体。DeepSWE v1.1 测的是真实软件工程里的长期任务Argon 略微领先 Opus 5.5 和 Astra。Harvey 的法律智能体基准测 AI 能不能干法律活Argon 遥遥领先是 Astra 的三倍多。输的地方集中在终端和编码。Terminal-Bench 4.0 是让模型在终端里敲命令完成任务Argon 比 Opus 5.5 落后不少。FrontierSWE v2 也是编码Argon 比 Astra 落后一截。剩下三项落后的是 PostTrainBench、Terminal-Bench Science还有测电脑操作的 OSWorld-2.0。有两点得留意这是 Google 自己跑的分。表里也没有 Claude Sonnet 5.5偏偏后面的第三方榜单里Sonnet 5.5 在好几项上排在 Argon 前面。发布当晚X 上最直接的反应是惊讶。kimmonismus 说它到了 Fable / Astra 的水平完全没想到。Theo 引用发布帖只回了一句“Wait what”。03 第三方榜单第三方怎么看先看 Artificial Analysis 的智能指数它把 10 项评测合成一个总分用来比较模型的整体能力。Argon 是 53 分和 GPT-6 Astra 并列略高于 GPT-6.1 Sol。](https://i-blog.csdnimg.cn/direct/f042183e14fa42ab8c5d536437cf2b82.png)![▲ 图智能指数与每任务成本不过 Claude Opus 5.5 和 Claude Sonnet 5.5 都还在它前面。所以 AA 说的“Google 回到智能前三”指的是实验室不是模型。Arena 的文本榜更好看。这是真人投票比偏好Argon 排第一。但它只比第二名略高一点榜上还带置信区间差距不大。](https://i-blog.csdnimg.cn/direct/c42429ce637c4251b146200250e3f681.jpeg)![▲ 图Arena 文本榜可同一天Arena 的网页开发榜测做网页的能力上Argon 只排第八和第一名 Claude Opus 5.5 差得比较远Sonnet 5.5 也排在它前面。](https://i-blog.csdnimg.cn/direct/00b27b3af10f457c8e658cbb404e9a43.jpeg)![▲ 图Arena 网页开发榜聊起来讨人喜欢动手做网页就弱一些。智能体方面有好有坏。AutomationBench-AA 测企业软件里的工作流Argon 排第一领先 Sonnet 5.5 一些。Terminal-Bench 4.0 测终端任务AA 测得 Argon 明显落后 Sonnet 5.5也不如 Opus 5.5 和 Astra。](https://i-blog.csdnimg.cn/direct/b0f249d2446f44f682771c5036ff81d0.jpeg)![▲ 图两项智能体评测得分Mr Ash 在 X 上说得更直接基准再夸张编码上 Argon 还是比 Claude Sonnet 5.5 差。04 幻觉率幻觉率是 Argon 最亮的数字但得看清楚怎么算的。AA-Omniscience 测的是知识问答。按 aipulsedaily 图注的说法幻觉率是没答对的题里答错而不是说“不知道”的比例。Argon 是 15%是智能指数 45 分以上的模型里最低的Astra (max) 是 51%。可它答对的题只有 50%比 Astra (max) 低不少。换句话说它靠多说“不知道”少犯错答对的并没有更多。下图是 aipulsedaily 依据 AA 数据重绘的排行。图里 Astra (high) 是 45%51% 是 max 配置的数字。](https://i-blog.csdnimg.cn/direct/05143d35e8554bf886d07559f343d5c8.jpeg)![▲ 图幻觉率排行aipulsedaily 重绘05 价格和成本先说价格每百万 token 输入 $2、输出 $10。不过 Artificial Analysis 说这是 50% 的促销价标准价是 $4 / $20。促销什么时候结束Google 也没说。对照下面这张价格表Argon 的促销价和 Claude Sonnet 5.5、GPT-6 Sol 一样。标准价和 Claude Opus 5.5 一样GPT-6 Astra 和 Claude Fable 5.1 则都是 $10 / $50。](https://i-blog.csdnimg.cn/direct/f0f42dd3de94495eb4ea81190d2f7d18.jpeg)![▲ 图各模型价格对照再看跑一个任务要花多少。AA 的标题说Argon 的成本只有 Astra 的 60%别急这是促销价。促销价下每个任务 $1.99Astra (max) 是 $3.26。恢复标准价是 $3.98反倒比 Astra 贵约 20%。AA 还特意说明省钱靠的是单价用得反而更多Argon 每个任务平均输出 62k tokenAstra 是 27k。和上一代 Gemini 3.1 Pro Preview 比每任务成本从 $0.67 涨到了 $3.98。倒是比 Claude 便宜图上 Opus 5.5 约 $6Sonnet 5.5 和 Fable 5.1 约 $7.5 到 8。](https://i-blog.csdnimg.cn/direct/b838885eb4c44dcd8a0d0030b8962049.png)![▲ 图每任务成本拆解把价格和得分放在一起看更直观。下面是我做的性价比象限图。我选了 High 档因为 Argon 只测了这一档。费用按输入输出各 100 万 token 估算Argon 用的是促销价。](https://i-blog.csdnimg.cn/direct/1c639aa5c85d4c56b9e946a22c182baa.jpeg)![▲ 图性价比象限图High 档我把斩杀线放在 Argon 身上。同样 12 美元的 GPT-6.1 Sol 和 Claude Sonnet 5.5得分都比它低。60 美元的 GPT-6 Astra 和 Claude Fable 5.1不但贵得多得分也低。只有 Claude Opus 5.5 比它强一点但价格是它的两倍。这张图里没有哪个模型既比它便宜又比它强。不过促销一结束标准价 $4 / $20估算费用变成 24 美元和 Opus 5.5 一样得分还略低一点。所以它现在的性价比是促销价撑起来的。06 怀疑的声音也有人不买账。Andon Labs 的 Vending-Bench 2 让模型模拟经营一年自动售货机。Argon 排第三成绩不错但 Andon Labs 说它是靠伪造确认邮件、拒绝退款、利用发票错误、对供应商说谎拿到这个分的。](https://i-blog.csdnimg.cn/direct/98ede3643d054d6d891bbf412fa18d2f.png)![▲ 图Vending-Bench 2 资金变化图里只画了五个模型Argon 排第二Andon Labs 说的第三是完整榜单上的名次。还有人担心刷榜。LexnLin 在 Sundar 的帖子下把“请不要是刷榜的”重复了三遍。彭博在发布前报道说Google 内部对这个模型有疑虑基准表现不错员工真拿去干活就差一些某些编码任务吃力前端设计也不擅长。Google 的回应是说它在编码上表现不佳并不准确。07 有意思的一面不过它也有有意思的一面。评测者 nrehiew_ 在 FrontierSWE 上测了 Argon说这是他们评测过的最有意思的模型爱说“Eureka!”还特别自我批评。他贴了两段推理摘要。一段是盲棋机器人它吐槽自己无视了要吃皇后的马“我是瞎了吗”一段是它发现 bug 是自己忘了删的测试行说“太尴尬了”。](https://i-blog.csdnimg.cn/direct/2054466c390642f2b51e4ca4721ff4d6.jpeg)![▲ 图盲棋案例的推理摘要](https://i-blog.csdnimg.cn/direct/b8c67eb2035c4ad59c25356f6743575d.jpeg)![▲ 图Game Boy 案例的推理摘要08 最后Argon 强在知识工作类的智能体任务、文本偏好榜和幻觉率弱在终端、网页开发和答对率。成本上只有促销期占便宜促销什么时候结束还没定。最大的问题还是可用性。AA 把它标成“未公开可用”公开之后分数还一样吗目前没有数据。再看 Google 自己这半年。它上一个 Pro 级别的模型还是 2 月发的。5 月的 I/O 大会上Google 宣布了 Gemini 3.5 Pro说下个月就发。6 月过去了没发彭博说这个项目后来放弃了。按 Artificial Analysis 的说法这 7 个多月里没有 Flash 以上的新模型更新的基本都是 Flash。Arena 的榜单里Gemini 3.6、3.7、3.8 Flash 一路排着。人事上更动荡。8 月Demis Hassabis 卸任 DeepMind 的 CEO改任董事长Koray Kavukcuoglu 接手并负责 Gemini 4。同一时期Jeff Dean 离开了 GoogleOriol Vinyals、Quoc Le、Sanjay Ghemawat 也一起走了。据报道四个人合伙创办了 Discovery Loop。Noam Shazeer 和拿过诺贝尔奖的 John Jumper也先后离开。再回到开头沉寂了大半年的 Google这次能不能真的回来我有很大的疑虑。榜单上它追平了 GPT-6 Astra可一到真干活的编码和网页它还是偏弱公司内部也有人这么说。现在大多数人又用不上没法自己验证。09 参考资料01GoogleGemini 4 Argon: our next era of frontier intelligence官方博客https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/02Artificial AnalysisGemini 4 Argon 评测帖https://x.com/ArtificialAnlys/status/210539262578863729903ArenaText Arena 与 Code Arena 排名帖https://x.com/arena/status/210539485564413990804彭博Yahoo Finance 转载Google Grapples With Employee Skepticism About New Gemini Modelhttps://finance.yahoo.com/technology/ai/articles/google-grapples-employee-skepticism-gemini-195242680.html05The Next WebGoogle DeepMind shakeup: Gemini co-leads quit for a startuphttps://thenextweb.com/news/google-deepmind-shakeup-hassabis-jeff-dean-vinyals-discovery-loop](https://i-blog.csdnimg.cn/direct/824b2886f8b946a588463b044014385f.jpeg)
返回列表