Gemini 4 Argon 发布:输出上限拉到 100 万 token,先给安全专家用

2026-10-05 11:02 👁️ 4 阅读
https://blog.google/ , https://deepmind.google/

先说几个判断:

第一,Gemini 4 Argon 最硬的指标是输出 token 上限从 6.4 万拉到 100 万——翻了约 15 倍。这不是“更会聊”,而是让模型能一口气跑完需要大量中间产出的长任务。

第二,它把“网络防御”摆到了和编码、企业知识工作并列的一线位置,并且能自主发现、验证、修复关键漏洞(官方引用的 CWE-bench v1 得分 68%)。把“修漏洞”当成模型能力而不是工具插件,是这次发布里最值得盯的点。

第三,上线是“受控分阶段”的:先开放给通过审核的网络安全专业人员(Fairwind Program),不是对所有人直接敞开。对一个能自主找漏洞的模型,这种克制是刻意的设计。

第四,推广期 API 定价输入 2 美元、输出 10 美元每百万 token,属于旗舰档位;第三方评测(Artificial Analysis)把它的智能指数放在 53、与 GPT-6 Astra 持平。这些第三方数字要单独看,不等于 Google 自己的说法。

下面把这些点展开说一说。

一、事件描述

Google 在 2026 年 9 月底官宣、10 月初补充细节,推出下一代旗舰前沿模型 Gemini 4 Argon。DeepMind 官网把它归入 2026 年 9 月的 Models 栏目,标题是“我们的下一个前沿智能时代”(Our next era of frontier intelligence);Google 官方博客的 teaser 原文写着,它是“面向真实世界编码、企业知识工作和网络防御的前沿模型,即将推出”。

这次发布有几个容易混的点,先用一张表理清口径:

事项 内容 来源属性
模型与定位 Gemini 4 Argon,Google 下一代旗舰前沿模型 Google 官方
发布时间 9 月 30 日官宣,10 月 3 日公布细节 按发布节奏
核心场景 真实世界编码、企业知识工作、网络防御 Google 官方 teaser
输出 token 上限 100 万(上代 6.4 万) 官方公布
自主漏洞能力 自主发现 / 验证 / 修复关键漏洞,CWE-bench v1 68% 官方公布
上线方式 受控分阶段,先开放 Fairwind Program 审核安全专家 官方公布
推广期定价 输入 $2 / 输出 $10 每百万 token 官方公布
第三方评测 智能指数 53、与 GPT-6 Astra 持平、幻觉率领先梯队最低、AutomationBench-AA 第一 Artificial Analysis(第三方)

表:Gemini 4 Argon 发布要点与口径归属(官方信息来自 blog.google 与 deepmind.google,第三方指标来自 Artificial Analysis)

这里要特意把最后一行的归属标清:智能指数、幻觉率、AutomationBench-AA 这类数字来自 Artificial Analysis 的独立评测,不是 Google 自己发布的成绩。写进文章里时,它们该被当作“第三方视角”,而不是 Google 的主张。

二、100 万输出 token 意味着什么

把输出上限从 6.4 万拉到 100 万,是这次最直观的数字变化:

模型 输出 token 上限
上一代(Gemini 前代) 64,000
Gemini 4 Argon 1,000,000

表:输出 token 上限对比(官方公布)

画成条形会更直观:

图:Gemini 4 Argon 与上代输出 token 上限对比(数据来源:Google 官方公布,单位 token;条形按真实数值线性映射)

上一代            ████                                                      64,000
Gemini 4 Argon  ████████████████████████████████████████████████████████ 1,000,000

说明:条形长度按各模型输出 token 上限真实数值线性缩放,Argon 约为上一代的 15.6 倍。输出上限翻倍的意义,不在于“能写更长的文章”,而在于模型能在一次任务里保留更长的推理轨迹、工具调用记录与中间产物——这恰恰是软件工程、长文档分析这类“长周期任务”的刚需。

三、为什么把“网络防御”放这么前

官方 teaser 把三个场景并列:真实世界编码、企业知识工作、网络防御。其中“网络防御”最不寻常——它不是把模型当助手用,而是让模型去“自主发现、验证、修复关键漏洞”,并给出了 CWE-bench v1 上 68% 的得分。

CWE-bench 这类基准测的是模型在真实漏洞库上定位并修复缺陷的能力。68% 不是一个“满分”数字,它说明模型已经能稳定处理相当一部分真实漏洞,但远没到“全自动替代安全团队”的程度。把这个能力直接写进发布重点,说明 Google 在把“安全”从模型的附加技能,升级成一类被单独强调的工作负载。

四、受控上线:先给“自己人”

对一个能自主找漏洞的模型,怎么放出来是个真问题。Google 选的是受控分阶段:先向通过审核的网络安全专业人员开放,这个审核通道叫 Fairwind Program。

值得注意的有两点。一是“分阶段”本身——不是全员立即可用,而是按人群和场景逐步放开;二是“审核”门槛——把最敏感的能力先圈在受过训练、有合规约束的安全专家手里。这是一种把“能力”和“使用资格”绑定的上线策略,和很多模型“先全量、再治理”的节奏相反。

五、定价:旗舰档,且是推广期

推广期 API 定价为输入 2 美元、输出 10 美元每百万 token。这个价位属于前沿旗舰的常规区间,但要注意“推广期”三个字——它不等于长期定价,后续是否调整要看 Google 的正式价目表。

对一个输出上限 100 万 token 的模型,计费方式也值得留意:输出 token 比输入贵 5 倍,意味着你让模型“想得多、写得长”,成本会随输出量快速累积。长周期自主任务天然产出大量 token,跑这类任务前,账要单独算。

六、第三方视角:和 GPT-6 Astra 持平?

据 Artificial Analysis 的第三方评测,Gemini 4 Argon 的智能指数(Intelligence Index)为 53,与 GPT-6 Astra 持平;在幻觉率上处于领先梯队的最低区间,并在 AutomationBench-AA 上拿了第一。

这些数字能帮你做横向参考,但要带着两条前提看:第一,它们是第三方口径,不是 Google 自己的结论;第二,“持平”“第一”都依附于具体基准的方法与快照时间,基准一换、版本一更,排位就会动。把它当作“当下某份榜单上的相对位置”,比当作“绝对强弱结论”更稳妥。

七、结语

Gemini 4 Argon 是 Google 在 2026 年 9 月底至 10 月初推出的下一代旗舰前沿模型:输出 token 上限从 6.4 万提到 100 万,把真实世界编码、企业知识工作和网络防御列为一线场景,声称能自主发现、验证、修复关键漏洞(CWE-bench v1 68%),并采用受控分阶段上线、先开放给 Fairwind Program 审核的安全专家,推广期 API 定价输入 2、输出 10 美元每百万 token。

值得冷静看待的至少有三处:一是“自主修漏洞”这个能力被单列强调,但 68% 远非满分,距离全自动仍有距离;二是上线刻意走“审核 + 分阶段”,对一个能找漏洞的模型,这种克制更像设计而非疏忽;三是所有“与 GPT-6 Astra 持平、幻觉率最低、AutomationBench-AA 第一”的说法来自 Artificial Analysis 第三方评测,不是 Google 自述。对使用者来说,真正要掂量的是:当模型能一口气跑完百万 token 的长任务、还能自己动手修漏洞时,你打算把它放进哪条工作流、又由谁来把关——这件事,比“又强了一点”更值得想清楚。