☰
最强模型先借给防御者:Gemini 4 Argon 发布,但 100 万输出 token 才是硬信号
2026/10/2 12:53:58 网站建设 项目流程

署名:专注 AI 工程化实践与出海外贸技术

一、发生了什么

9 月 30 日,Google 正式宣布新一代前沿模型Gemini 4 Argon(来源:Google 官方博客 The Keyword)。但这次发布最特别的地方是:普通用户暂时用不到。Argon 通过 Fairwind 计划率先只开放给一批受信任的网络安全防御专家,同时参与美国政府的模型发布前自愿评估流程,之后再分阶段放开。定价为每百万输入 Token 2 美元、输出 10 美元,缓存输入比标准输入便宜 95%。

二、技术拆解

这场发布会真正值得拆的是三个细节,而不是那张自报的跑分表。

细节一:发布顺序变了。Argon 定位是复杂长流程任务:软件工程、法律金融知识工作、网络安全防御。Google 官方称它可以「自主发现、验证并修补关键软件漏洞」(来源:The Keyword;Mashable 补充报道),因此无护栏版本只给受信任防御者和内部团队。Mashable 直接点破:这是跟随 OpenAI 和 Anthropic 的做法——旗舰模型的发布,从拼上货架速度,变成了拼谁敢先锁起来。

细节二:输出上限提到 100 万 token。这是本次最容易被略过、但工程含量最高的参数。官方说明是从上一代的 64K 直接提到行业领先的 1M(来源:The Keyword)。注意:输出上限不是上下文窗口——100 万 token 的输入上下文近两年已经很常见,但单次输出 100 万 token 是另一回事。输出上限决定的是:模型能在一条任务轨迹里连续推理和生成多长的内容。把它从 64K 拉到 1M,等于官方承认模型的使用形态已经是「一次轨迹跑完整个长任务」,不再需要外部脚手架把任务切成小段反复喂。

细节三:缓存输入 -95%。输入 2 美元、缓存输入等于 0.1 美元。上一轮降价潮里(9 月 22 日 Anthropic 和 OpenAI 同日降价),缓存折扣是 -60% 和 -90%,这次直接到 -95%,折扣力度继续加码(来源:The Keyword 官方定价页)。结合细节二看逻辑很通顺:输出上限 1M 意味着单条轨迹的 token 量暴涨,如果长 Agent 任务的输入前缀不能便宜地重复计费,长任务的成本根本压不住。缓存定价就是为 1M 输出时代准备的成本侧配套。

三、我的判断

第一,「先锁再放」会成为旗舰发布标配。这不是 Google 一家的选择,是三家的趋同。以后看到「史上最强模型发布」,第一反应不该是「什么时候能用」,而是「它现在在谁手里、用来防什么」。模型能力越接近自主执行,发布通道就越像安全审批流程。

第二,输出上限是比跑分更硬的选型参数。选模型做长 Agent 任务时,大多数人看上下文窗口(输入能装多少),但真正的天花板往往是输出上限(一次能干多长)。输入 1M、输出 64K 的模型,跑长任务仍然要在外层做断点续传;输出上限提上去之后,应用架构里「任务切分 + 结果拼接」的胶水代码有了被删掉的可能。这和激活参数、总参数是两本账是一个道理。

第三,跑分照例是自报的。DeepSWE v1.1 77.9%、AutomationBench 51.3%、LVBench 91.7%,全部来自 Google 自己的口径,尚无第三方复现。这与我上一篇写 Liquid d1 时说过的一样:榜首数字先看,钱包后掏。另一个值得留意的点是「优惠价」三个字——首发价通常不是长期价。

四、对开发者的启示

  1. 把输出上限加进模型选型表。评估长 Agent 任务时,除了上下文窗口和价格,明确记录「单次输出上限」,它直接决定外层调度复杂度。
  2. 缓存命中率要开始重点监控。缓存折扣到 -95% 后,同样的工作流,前缀治理得好与不好,输入侧成本能差一个数量级。
  3. 别急着排队等权限。分阶段发布意味着公测版大概率带护栏降级,先做基准测试,等正式放开再迁移不迟。

FAQ

Q:100 万输出 token,一般任务用得到吗?
用不到。单轮问答的输出通常几百到几千 token。1M 输出主要面向大代码库迁移、深度研究、长流程 Agent 这类单轨迹超长任务。对大多数场景,64K 输出上限依然够用。

Q:缓存输入 -95% 是所有调用自动生效吗?
不是。缓存命中需要请求前缀与已缓存内容一致,通常依赖框架显式管理缓存断点。前缀不稳定,缓存永远打不中,折扣就与你无关。

Q:Argon 现在能直接调用吗?
目前只通过 Fairwind 计划向受信任的网络安全防御者开放,公测时间和正式放开时间官方均未公布。定价已公布但属于「首发优惠价」。


附:长任务 Agent 输出预算与缓存成本测算脚本

完整脚本放这里,可以直接拿走。改三个参数就能算:你的任务预估输出量、缓存命中率、各家单价。

# agent_budget_calc.py# 长任务 Agent 的输出预算与缓存成本测算# 用法: python agent_budget_calc.pydefcalc_cost(input_tokens:float,output_tokens:float,cache_hit_ratio:float,# 0~1, 前缀缓存命中率price_in:float,# 每百万输入 token 单价(美元)price_out:float,# 每百万输出 token 单价(美元)cache_discount:float,# 缓存输入折扣, 如 0.95 表示便宜 95%)->dict:"""返回一次长任务调用的成本拆解(美元)"""cached=input_tokens*cache_hit_ratio fresh=input_tokens-cached unit=1_000_000cost=(fresh/unit*price_in+cached/unit*price_in*(1-cache_discount)+output_tokens/unit*price_out)return{"cost_total_usd":round(cost,4),"cached_tokens":int(cached),"fresh_tokens":int(fresh),"cost_if_no_cache":round(input_tokens/unit*price_in+output_tokens/unit*price_out,4),}if__name__=="__main__":# 例:一条长轨迹,输入 80 万 token(80% 命中缓存),# 输出 60 万 token,按首发价 $2/$10、缓存 -95% 估算r=calc_cost(input_tokens=800_000,output_tokens=600_000,cache_hit_ratio=0.80,price_in=2.0,price_out=10.0,cache_discount=0.95,)fork,vinr.items():print(f"{k}:{v}")# 结论:同样负载,缓存命中率从 0 提到 80%,# 输入侧成本从 $1.6 降到约 $0.24 —— 前缀治理值不值,一算便知

上周我在《GPT-6 Sol/Luna 与 Opus 5.5 同日降价:价格表里最该看的,是缓存那一行》(https://blog.csdn.net/qq_43274490/article/details/166491822 )里说过缓存定价是价格战主战场,这次 Google 把折扣推到 -95%,算是给那个判断又加了一个注脚。更早之前在《600B 只激活 27B、成本 1/8》(https://blog.csdn.net/qq_43274490/article/details/166254348 )里写过「参数要看两本账」,这次输入上限和输出上限的两本账,是同一个思维方式的续集。

长 Agent 任务的爆炸半径问题,我在《本周 AI 观察:950 个 Agent 发现新酶,1 万个抢跑数学大奖》(https://blog.csdn.net/qq_43274490/article/details/166646338 )里整理过一份上线前自查清单,可以和本文的输出预算脚本配合着用。而自报跑分该怎么冷静看待,昨天那篇《Liquid d1 登顶决策模型榜》(https://blog.csdn.net/qq_43274490/article/details/166902989 )聊得更细。

这个专栏每天一篇 AI 解读,关注不迷路。

你们团队现在跑长 Agent 任务时,输出端的任务切分和拼接逻辑写了多少行胶水代码?如果输出上限提到 1M,这层代码打算删吗?


专注 AI 工程化实践与出海外贸技术

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询