先说几个判断:
第一,Gemini 4 Argon 最硬的指标是输出 token 上限从 6.4 万拉到 100 万——翻了约 15 倍。这不是“更会聊”,而是让模型能一口气跑完需要大量中间产出的长任务。
第二,它把“网络防御”摆到了和编码、企业知识工作并列的一线位置,并且能自主发现、验证、修复关键漏洞(官方引用的 CWE-bench v1 得分 68%)。把“修漏洞”当成模型能力而不是工具插件,是这次发布里最值得盯的点。
第三,上线是“受控分阶段”的:先开放给通过审核的网络安全专业人员(Fairwind Program),不是对所有人直接敞开。对一个能自主找漏洞的模型,这种克制是刻意的设计。
第四,推广期 API 定价输入 2 美元、输出 10 美元每百万 token,属于旗舰档位;第三方评测(Artificial Analysis)把它的智能指数放在 53、与 GPT-6 Astra 持平。这些第三方数字要单独看,不等于 Google 自己的说法。
下面把这些点展开说一说。
一、事件描述
Google 在 2026 年 9 月底官宣、10 月初补充细节,推出下一代旗舰前沿模型 Gemini 4 Argon。DeepMind 官网把它归入 2026 年 9 月的 Models 栏目,标题是“我们的下一个前沿智能时代”(Our next era of frontier intelligence);Google 官方博客的 teaser 原文写着,它是“面向真实世界编码、企业知识工作和网络防御的前沿模型,即将推出”。
这次发布有几个容易混的点,先用一张表理清口径:
| 事项 | 内容 | 来源属性 |
|---|---|---|
| 模型与定位 | Gemini 4 Argon,Google 下一代旗舰前沿模型 | Google 官方 |
| 发布时间 | 9 月 30 日官宣,10 月 3 日公布细节 | 按发布节奏 |
| 核心场景 | 真实世界编码、企业知识工作、网络防御 | Google 官方 teaser |
| 输出 token 上限 | 100 万(上代 6.4 万) | 官方公布 |
| 自主漏洞能力 | 自主发现 / 验证 / 修复关键漏洞,CWE-bench v1 68% | 官方公布 |
| 上线方式 | 受控分阶段,先开放 Fairwind Program 审核安全专家 | 官方公布 |
| 推广期定价 | 输入 $2 / 输出 $10 每百万 token | 官方公布 |
| 第三方评测 | 智能指数 53、与 GPT-6 Astra 持平、幻觉率领先梯队最低、AutomationBench-AA 第一 | Artificial Analysis(第三方) |
表:Gemini 4 Argon 发布要点与口径归属(官方信息来自 blog.google 与 deepmind.google,第三方指标来自 Artificial Analysis)
这里要特意把最后一行的归属标清:智能指数、幻觉率、AutomationBench-AA 这类数字来自 Artificial Analysis 的独立评测,不是 Google 自己发布的成绩。写进文章里时,它们该被当作“第三方视角”,而不是 Google 的主张。
二、100 万输出 token 意味着什么
把输出上限从 6.4 万拉到 100 万,是这次最直观的数字变化:
| 模型 | 输出 token 上限 |
|---|---|
| 上一代(Gemini 前代) | 64,000 |
| Gemini 4 Argon | 1,000,000 |
表:输出 token 上限对比(官方公布)
画成条形会更直观:
图:Gemini 4 Argon 与上代输出 token 上限对比(数据来源:Google 官方公布,单位 token;条形按真实数值线性映射)
上一代 ████ 64,000
Gemini 4 Argon ████████████████████████████████████████████████████████ 1,000,000
说明:条形长度按各模型输出 token 上限真实数值线性缩放,Argon 约为上一代的 15.6 倍。输出上限翻倍的意义,不在于“能写更长的文章”,而在于模型能在一次任务里保留更长的推理轨迹、工具调用记录与中间产物——这恰恰是软件工程、长文档分析这类“长周期任务”的刚需。
三、为什么把“网络防御”放这么前
官方 teaser 把三个场景并列:真实世界编码、企业知识工作、网络防御。其中“网络防御”最不寻常——它不是把模型当助手用,而是让模型去“自主发现、验证、修复关键漏洞”,并给出了 CWE-bench v1 上 68% 的得分。
CWE-bench 这类基准测的是模型在真实漏洞库上定位并修复缺陷的能力。68% 不是一个“满分”数字,它说明模型已经能稳定处理相当一部分真实漏洞,但远没到“全自动替代安全团队”的程度。把这个能力直接写进发布重点,说明 Google 在把“安全”从模型的附加技能,升级成一类被单独强调的工作负载。
四、受控上线:先给“自己人”
对一个能自主找漏洞的模型,怎么放出来是个真问题。Google 选的是受控分阶段:先向通过审核的网络安全专业人员开放,这个审核通道叫 Fairwind Program。
值得注意的有两点。一是“分阶段”本身——不是全员立即可用,而是按人群和场景逐步放开;二是“审核”门槛——把最敏感的能力先圈在受过训练、有合规约束的安全专家手里。这是一种把“能力”和“使用资格”绑定的上线策略,和很多模型“先全量、再治理”的节奏相反。
五、定价:旗舰档,且是推广期
推广期 API 定价为输入 2 美元、输出 10 美元每百万 token。这个价位属于前沿旗舰的常规区间,但要注意“推广期”三个字——它不等于长期定价,后续是否调整要看 Google 的正式价目表。
对一个输出上限 100 万 token 的模型,计费方式也值得留意:输出 token 比输入贵 5 倍,意味着你让模型“想得多、写得长”,成本会随输出量快速累积。长周期自主任务天然产出大量 token,跑这类任务前,账要单独算。
六、第三方视角:和 GPT-6 Astra 持平?
据 Artificial Analysis 的第三方评测,Gemini 4 Argon 的智能指数(Intelligence Index)为 53,与 GPT-6 Astra 持平;在幻觉率上处于领先梯队的最低区间,并在 AutomationBench-AA 上拿了第一。
这些数字能帮你做横向参考,但要带着两条前提看:第一,它们是第三方口径,不是 Google 自己的结论;第二,“持平”“第一”都依附于具体基准的方法与快照时间,基准一换、版本一更,排位就会动。把它当作“当下某份榜单上的相对位置”,比当作“绝对强弱结论”更稳妥。
七、结语
Gemini 4 Argon 是 Google 在 2026 年 9 月底至 10 月初推出的下一代旗舰前沿模型:输出 token 上限从 6.4 万提到 100 万,把真实世界编码、企业知识工作和网络防御列为一线场景,声称能自主发现、验证、修复关键漏洞(CWE-bench v1 68%),并采用受控分阶段上线、先开放给 Fairwind Program 审核的安全专家,推广期 API 定价输入 2、输出 10 美元每百万 token。
值得冷静看待的至少有三处:一是“自主修漏洞”这个能力被单列强调,但 68% 远非满分,距离全自动仍有距离;二是上线刻意走“审核 + 分阶段”,对一个能找漏洞的模型,这种克制更像设计而非疏忽;三是所有“与 GPT-6 Astra 持平、幻觉率最低、AutomationBench-AA 第一”的说法来自 Artificial Analysis 第三方评测,不是 Google 自述。对使用者来说,真正要掂量的是:当模型能一口气跑完百万 token 的长任务、还能自己动手修漏洞时,你打算把它放进哪条工作流、又由谁来把关——这件事,比“又强了一点”更值得想清楚。