
Gemini 4 登场了输出 100 万 token、幻觉率降到 15.1%但你现在还用不上9 月 30 日美国当地时间谷歌发布了 Gemini 4 这一代的首款模型型号名 Argon。它最实在的三个变化是一次能输出 100 万个 token、每百万 tokens 的输入价定在 2 美元、以及专门为了“连续干几小时的活”而优化。最容易被忽略的一个事实是你现在还用不上它。第一批拿到访问权的不是普通用户也不是开发者而是一批做网络安全防御的机构。这篇不吹不黑只做三件事把谷歌这份发布稿里的数字翻译成人话告诉你它到底哪里变强、哪里没赢最后给你三个现在就能做的动作——而不是让你熬夜等解锁。先给结论登场的是谁你现在能不能用先把最容易讲错的三件事说清楚。第一登场的是“Gemini 4 的第一款”不是“Gemini 4 的全部”。多家媒体都用了“首款旗舰模型”这个说法也就是说 Argon 是这一代里最先出场的最高端那一款后续还会有便宜档、快速档。谷歌没有公布后面几款的时间。所以如果你在网上看到“Gemini 4 全线上线”那是把话说大了。第二它是一次换代不是挤牙膏。谷歌上一条真正的旗舰线是 2025 年 11 月 18 日的 Gemini 3 Pro这次是 2026 年 9 月 30 日中间隔了 10 个多月。这期间谷歌发了三四个带小数点的版本下面第二节会讲但那些是小改款。第三普通人拿不到。目前的开放顺序是先给“Fairwind 计划”里的可信网络安全机构和部分政府预发布项目然后是付费调用 API 的开发者和 Google AI Ultra谷歌最高档的订阅用户普通订阅档要往后排。谷歌没有公布面向公众开放的时间只表示会“尽可能迅速、同时以安全的方式扩大开放”。这句话的重点在后半句。为什么隔了 10 个多月小数点和换代是两回事要理解这次发布为什么被这么多人在意得先看这一年半谷歌的节奏。把公开报道里的日期排成一条线事情就清楚了时间谷歌做了什么2025-11-18Gemini 3 Pro 发布这一代的旗舰2026-02-19Gemini 3.1 Pro小改款2026-05-19Google I/O 上承诺“3.5 Pro 下个月发”2026-07-16彭博报道延期原因是编程能力不达标2026-07-22CEO 皮查伊承认推迟改口“Gemini 4 年底发”2026-07-21 至 09-02连发 3.6 / 3.7 / 3.8 三款 Flash快速档2026-09-30Gemini 4 首款旗舰 Argon 发布这条线上有两个细节值得记住。一个是3.5 Pro 根本没发出来。承诺“下个月发”之后 60 多天没有动静媒体给出的原因是编程能力没达标。对普通用户来说这意味着一件事当你看到某个模型版本号从 3.1 跳到 3.6别以为它变强了 5 倍——那更可能是同一代产品在做修补和降价而不是换代。另一个是这次比承诺的“年底”提前了。皮查伊 7 月说的是年底实际 9 月底就端出来了。业界普遍把它解读为竞争压力这一年对手的日子都不好过——同一时间线上OpenAI 和 Anthropic 各自都有新款旗舰在前面跑谷歌被甩在了后面。顺带解释一个词。旗舰frontier model直译“前沿模型”指的是各家最贵、最强、最近更新的那一款它下面还有“快速档”“迷你档”这些便宜但弱的兄弟型号。你平时在 App 里默认用到的往往不是旗舰。这次真正改的三件事改动一单次输出上限提到 100 万 token。这是 Argon 最硬的参数变化也是媒体标题里的常客。先解释一下这两个词token模型眼里的“字”。它不是一个汉字也不是一个英文单词而是被切成的小片段中文大约 1 个字合 11.5 个 token英文大约 1 个词合 1.3 个 token。输入 / 输出你发给它的内容算输入它回给你的算输出。两者分开计价输出通常贵 45 倍。“输出 100 万 token”意味着它一口气能写完大约七八十万字的内容。听起来夸张但它的真实用途不是写长文而是让模型有地方“思考”现在的模型在解复杂问题时会先生成一大段中间推理再给结论。推理过程越长能力越强也越吃输出额度。把输出上限拉高本质是给思考腾地方。这跟你有什么关系如果你只让它写周报、润色邮件100 万输出对你毫无意义。它只对一类场景有价值把一整件事交给它——比如改一个大型代码库、把几十份文档读完再写结论、连续调用工具跑几十步。这类“长流程任务”才是这代模型真正的目标。改动二价格是冲着“便宜”去的。早期定价是每百万 tokens 输入 2 美元、输出 10 美元命中缓存的输入只要 0.1 美元。有报道按“完成一个任务”来算成本给出约 1.99 美元一个任务、比对手低四成左右也有媒体按 token 单价算出“只有对手的几分之一”。这里有个坑必须提醒你单价便宜不等于总花费便宜。输出上限从原来的几万拉到 100 万意味着模型一次可能写回你几十倍的内容而输出单价是输入的 5 倍。如果你不做任何限制账单完全可能不降反升。想把自己的调用成本算清楚可以先看这篇每百万 tokens 到底是多少字三步算清一次 AI 调用要花多少钱里面按汉字给你换算过了。顺便提一句价格战这个大背景9 月下旬刚刚出现过凌晨 90 分钟的价格战Claude Opus 5.5 刚发布OpenAI 反手把 API 永久砍半。Argon 这次的定价本质上是被这条战线逼出来的。改动三主打“长流程”但这也暴露了它的偏好。谷歌公布的成绩单里最能打的是长链条任务编程类第三方评测 DeepSWE v1.1 拿了 77.9%自动化任务 AutomationBench 51.3%金融代理任务 65.4%。而在需要模型从零搭一个项目、或者在真实终端里一步步操作时它反而落后。跑分怎么读它赢了什么又没赢什么这是本篇最想教你的部分因为同一个发布你看到的数字可能全不一样。关于“赢了几项”媒体至少给出了三种说法18 项评测里领先 12 项、19 项里 13 项第一、14 项基准第一。这不是有人在编数据而是因为谷歌那张对照表里有些项是第三方机构跑的、有些项自己并列第一、有些项要不要算进去各家判断不同。所以第一条经验是“屠榜”这种词没有信息量你要问的是“哪几项、多少分、谁测的”。这套读法我在怎么读一份大模型发布稿六个数分三组看三个地方最容易讲错里拆过六步这次正好拿来用。第二件事更反直觉Argon 并没有全面领先。按谷歌自己那张表它至少在这两项上排在对手后面——从零构建项目FrontierSWE v255.0%对手 65.5%和在 Linux 终端里完成操作Terminal-Bench 4.057.4%对手 66.4%。落后大约 10 个百分点。也就是说越像“给它一个全新烂摊子让它自己收拾”的任务它越吃亏越像“给它一份清晰材料让它推到底”的任务它越占便宜。第三件事也是我最想让你记住的一组数字来自独立评测机构 Artificial Analysis不做厂商宣传、自己重跑所有模型的一家第三方。它给 Argon 的公开数据是指标Argon 的数字这个数在说什么智能指数53综合难度的横向排名分不是百分制知识类答对率0.499约 49.9%有标准答案的题它对了一半幻觉率0.151约 15.1%越低越好答错里“硬答”的比例上下文窗口100 万 token一次能读进去多少这组数怎么读15.1% 的幻觉率是真的进步——同一份榜单上GPT-6 Astra 这项是 51.3%Claude Sonnet 5 是 39.4%。相比它们Argon 少胡说了一大截这个下降幅度值得单独夸。但同一份评测的另一栏在提醒你它的答对率只有约 49.9%。也就是说在那些有标准答案的知识题上它差不多是两次对一次。而且幻觉率最低的位置并不属于它榜单上还有另一款模型以 14.2% 略低一点。把这两个数字放在一起看你才真正读懂了这次发布它变得更不愿意瞎说了但它并没有变得更全知。这正是“AI 一本正经胡说八道”这件事的一个关键性质——所谓幻觉不是模型在撒谎而是它没有“我不知道”这个正常出口。想搞明白它为什么认不出自己的错看这篇AI 为什么会一本正经地胡说八道它认得出自己的错却不会主动说。为什么第一批不是给普通人用的Argon 把“网络安全防御”放在了开放顺序最前面这个决定本身就值得解释一次因为它关系到你以后每次用新模型的体验。理由是这类能力有反面。谷歌在发布材料里强调 Argon 擅长“长链条任务”——而把长链条能力放到代码和安全场景里同一个本事既能用来找出自家系统的漏洞也能用来找出别人的漏洞。厂商担心的正是后者。所以这一代的做法是先给防守方企业安全团队、部分政府机构观察一段时间再往外放。更值得注意的是另一条据媒体报道谷歌同时表示还计划推出一个不带护栏限制的版本。护栏就是模型内置的那些“这类问题我不答”的限制。这句话的意思是厂商打算把“要不要拆掉限制”做成一个单独的产品档位而不是全员放开。这类信息目前只在少数报道里出现谷歌没有公布时间你要留意的是别把它当成已经发生的事。同一时间还有一条容易让人误会传播的消息有 DeepMind 研究员在社交媒体上说Gemini 4 已经做到了 RSI——递归自我改进Recursive Self-Improvement指模型参与改进模型自身理论上会越滚越快原话大意是“模型已经超过我我教不动了”。这是研究员的个人说法谷歌没有确认实现只承认有早期迹象。你在转发时应注意“员工说”和“公司说”完全是两件事——这也是读 AI 新闻最容易踩的一个坑具体怎么分辨可以参考让 AI 替你办事的安全清单授权怎么给、钱怎么管、出事怎么办里关于“信息源分级”的思路。普通人的三个动作说了这么多落到你身上其实只有三件事可做。动作一别为了它换订阅、改配置。判断标准很简单没有公布公众开放时间的模型不值得你为它花钱。现在就有两个常见的坑一是有人趁机卖“内测资格”“镜像站”二是各种“接入教程”其实接的是旧模型换了个名字。真想第一时间知道开放只盯两个官方渠道就够谷歌云的产品更新页和你自己订阅档位的功能变更邮件。除此之外短视频里的“已经能用了”一律先当成假的。动作二先把长任务跑顺而不是先换模型。这次 Argon 提升最大的是长流程任务。而长流程任务做不好的原因八成不在模型在你的任务描述。一个简单的对照现象真正的原因你现在就能做的干到一半开始跑偏条件边聊边补它只保留了最近一轮把目标、限制、验收标准一次写全中间结果全对最后合不上输出太长早期要求被挤掉了每完成一段就让它复述一遍当前约定说它忘了刚才的话上下文有上限旧内容会被压缩关键约定单独贴回来别指望它记着这三条是同一件事的三个面模型没有“记住”这个动作只有“这次递进去多少”。具体怎么把要求写成它不会漏的格式核心就一句话把目标、限制、验收标准一次性写清楚并在关键节点让模型复述当前约定而不是依赖它“记住”之前的对话。如果你手上是编程类的长任务工程侧的核心做法是把上下文闭环起来——每次只递进去当前这一步需要的信息而不是把整段历史都塞给它。这样既能控制成本也能减少跑偏。动作三算清自己这一档值不值得等。新旗舰对你划不划算取决于两件事你现在用什么、你干的活有多长。国内用户还有一层现实Gemini 系列本身就不是能直接用的产品账号、网络、支付都有门槛。换新模型不会解决这些反而会增加折腾。与其等 Argon不如先把手上的模型用满——把长任务拆短、把提示词写清楚、把上下文控制好这些不换模型也能立刻见效。如果最终你要走 API 这条路长上下文的经济账还得单独算一次输出上限从几万涨到 100 万之后“一次能写多少”和“一次要花多少”这两件事的关系完全变了。核心提醒是单价便宜不等于总花费便宜务必给输出长度设上限否则账单可能不降反升。一句话版本Gemini 4 的首款旗舰 Argon 在 9 月 30 日发布隔了上一代 10 个多月它把单次输出提到 100 万 token、把输入价压到每百万 tokens 2 美元、专门优化长流程任务它在第三方幻觉率评测上从对手的 40%50% 降到 15.1%但同一份评测里它的知识答对率只有约 49.9%从零建项目和终端操作两项还落后对手 10 个百分点它现在只向网络安全防御机构开放公众什么时候能用谷歌没有说。你现在最该做的不是找渠道去用一场还没开始的发布会而是把手上的模型用到位。本文由 AgentHub 首发myagenthub.cn —— MCP Servers 与 Agent Skills 资源库。阅读原文https://myagenthub.cn/blog/gemini-4-argon-launch更多垂类 MCP 选型与安装教程MCP 工具库 · 安装配置教程 · 场景专区