ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

最强模型先借给防御者:Gemini 4 Argon 发布,但 100 万输出 token 才是硬信号

最强模型先借给防御者:Gemini 4 Argon 发布,但 100 万输出 token 才是硬信号 署名专注 AI 工程化实践与出海外贸技术一、发生了什么9 月 30 日Google 正式宣布新一代前沿模型Gemini 4 Argon来源Google 官方博客 The Keyword。但这次发布最特别的地方是普通用户暂时用不到。Argon 通过 Fairwind 计划率先只开放给一批受信任的网络安全防御专家同时参与美国政府的模型发布前自愿评估流程之后再分阶段放开。定价为每百万输入 Token 2 美元、输出 10 美元缓存输入比标准输入便宜 95%。二、技术拆解这场发布会真正值得拆的是三个细节而不是那张自报的跑分表。细节一发布顺序变了。Argon 定位是复杂长流程任务软件工程、法律金融知识工作、网络安全防御。Google 官方称它可以「自主发现、验证并修补关键软件漏洞」来源The KeywordMashable 补充报道因此无护栏版本只给受信任防御者和内部团队。Mashable 直接点破这是跟随 OpenAI 和 Anthropic 的做法——旗舰模型的发布从拼上货架速度变成了拼谁敢先锁起来。细节二输出上限提到 100 万 token。这是本次最容易被略过、但工程含量最高的参数。官方说明是从上一代的 64K 直接提到行业领先的 1M来源The Keyword。注意输出上限不是上下文窗口——100 万 token 的输入上下文近两年已经很常见但单次输出 100 万 token 是另一回事。输出上限决定的是模型能在一条任务轨迹里连续推理和生成多长的内容。把它从 64K 拉到 1M等于官方承认模型的使用形态已经是「一次轨迹跑完整个长任务」不再需要外部脚手架把任务切成小段反复喂。细节三缓存输入 -95%。输入 2 美元、缓存输入等于 0.1 美元。上一轮降价潮里9 月 22 日 Anthropic 和 OpenAI 同日降价缓存折扣是 -60% 和 -90%这次直接到 -95%折扣力度继续加码来源The Keyword 官方定价页。结合细节二看逻辑很通顺输出上限 1M 意味着单条轨迹的 token 量暴涨如果长 Agent 任务的输入前缀不能便宜地重复计费长任务的成本根本压不住。缓存定价就是为 1M 输出时代准备的成本侧配套。三、我的判断第一「先锁再放」会成为旗舰发布标配。这不是 Google 一家的选择是三家的趋同。以后看到「史上最强模型发布」第一反应不该是「什么时候能用」而是「它现在在谁手里、用来防什么」。模型能力越接近自主执行发布通道就越像安全审批流程。第二输出上限是比跑分更硬的选型参数。选模型做长 Agent 任务时大多数人看上下文窗口输入能装多少但真正的天花板往往是输出上限一次能干多长。输入 1M、输出 64K 的模型跑长任务仍然要在外层做断点续传输出上限提上去之后应用架构里「任务切分 结果拼接」的胶水代码有了被删掉的可能。这和激活参数、总参数是两本账是一个道理。第三跑分照例是自报的。DeepSWE v1.1 77.9%、AutomationBench 51.3%、LVBench 91.7%全部来自 Google 自己的口径尚无第三方复现。这与我上一篇写 Liquid d1 时说过的一样榜首数字先看钱包后掏。另一个值得留意的点是「优惠价」三个字——首发价通常不是长期价。四、对开发者的启示把输出上限加进模型选型表。评估长 Agent 任务时除了上下文窗口和价格明确记录「单次输出上限」它直接决定外层调度复杂度。缓存命中率要开始重点监控。缓存折扣到 -95% 后同样的工作流前缀治理得好与不好输入侧成本能差一个数量级。别急着排队等权限。分阶段发布意味着公测版大概率带护栏降级先做基准测试等正式放开再迁移不迟。FAQQ100 万输出 token一般任务用得到吗用不到。单轮问答的输出通常几百到几千 token。1M 输出主要面向大代码库迁移、深度研究、长流程 Agent 这类单轨迹超长任务。对大多数场景64K 输出上限依然够用。Q缓存输入 -95% 是所有调用自动生效吗不是。缓存命中需要请求前缀与已缓存内容一致通常依赖框架显式管理缓存断点。前缀不稳定缓存永远打不中折扣就与你无关。QArgon 现在能直接调用吗目前只通过 Fairwind 计划向受信任的网络安全防御者开放公测时间和正式放开时间官方均未公布。定价已公布但属于「首发优惠价」。附长任务 Agent 输出预算与缓存成本测算脚本完整脚本放这里可以直接拿走。改三个参数就能算你的任务预估输出量、缓存命中率、各家单价。# agent_budget_calc.py# 长任务 Agent 的输出预算与缓存成本测算# 用法: python agent_budget_calc.pydefcalc_cost(input_tokens:float,output_tokens:float,cache_hit_ratio:float,# 0~1, 前缀缓存命中率price_in:float,# 每百万输入 token 单价美元price_out:float,# 每百万输出 token 单价美元cache_discount:float,# 缓存输入折扣, 如 0.95 表示便宜 95%)-dict:返回一次长任务调用的成本拆解美元cachedinput_tokens*cache_hit_ratio freshinput_tokens-cached unit1_000_000cost(fresh/unit*price_incached/unit*price_in*(1-cache_discount)output_tokens/unit*price_out)return{cost_total_usd:round(cost,4),cached_tokens:int(cached),fresh_tokens:int(fresh),cost_if_no_cache:round(input_tokens/unit*price_inoutput_tokens/unit*price_out,4),}if__name____main__:# 例一条长轨迹输入 80 万 token80% 命中缓存# 输出 60 万 token按首发价 $2/$10、缓存 -95% 估算rcalc_cost(input_tokens800_000,output_tokens600_000,cache_hit_ratio0.80,price_in2.0,price_out10.0,cache_discount0.95,)fork,vinr.items():print(f{k}:{v})# 结论同样负载缓存命中率从 0 提到 80%# 输入侧成本从 $1.6 降到约 $0.24 —— 前缀治理值不值一算便知上周我在《GPT-6 Sol/Luna 与 Opus 5.5 同日降价价格表里最该看的是缓存那一行》https://blog.csdn.net/qq_43274490/article/details/166491822 里说过缓存定价是价格战主战场这次 Google 把折扣推到 -95%算是给那个判断又加了一个注脚。更早之前在《600B 只激活 27B、成本 1/8》https://blog.csdn.net/qq_43274490/article/details/166254348 里写过「参数要看两本账」这次输入上限和输出上限的两本账是同一个思维方式的续集。长 Agent 任务的爆炸半径问题我在《本周 AI 观察950 个 Agent 发现新酶1 万个抢跑数学大奖》https://blog.csdn.net/qq_43274490/article/details/166646338 里整理过一份上线前自查清单可以和本文的输出预算脚本配合着用。而自报跑分该怎么冷静看待昨天那篇《Liquid d1 登顶决策模型榜》https://blog.csdn.net/qq_43274490/article/details/166902989 聊得更细。这个专栏每天一篇 AI 解读关注不迷路。你们团队现在跑长 Agent 任务时输出端的任务切分和拼接逻辑写了多少行胶水代码如果输出上限提到 1M这层代码打算删吗专注 AI 工程化实践与出海外贸技术
返回列表