云导航 CloudNavi
← 返回文章列表
【2026年10月】Gemini 4 Argon 全面解读:100 万 token 输出与 19 项基准测试(附来源)
AI 模型·7 分钟阅读
#Gemini 4 Argon#Google DeepMind#Gemini#AI 模型#基准测试#价格比较

文章摘要

Gemini 4 Argon 现在还不能随便用。但把输出上限从 64K 提到 100 万 token,会改变长时任务型智能体的设计前提。

【2026年10月】Gemini 4 Argon 全面解读:100 万 token 输出与 19 项基准测试(附来源)


先说结论:Gemini 4 Argon 现在还不能随便用。但把输出上限从 64K 提到 100 万 token,会改变长时任务型智能体的设计前提。

2026 年 9 月 30 日,Google DeepMind 发布了 Gemini 4 世代的首个模型「Gemini 4 Argon」。官方博客和 X 上的 @GoogleDeepMind 账号同时发布,并公开了 19 项基准测试的对比表。

本文把官方博客、X 发布帖、基准测试表的全部数据,以及海外媒体的后续报道对照整理,说明这些数字意味着什么,以及「自己什么时候能用上」。

本文可以了解到

  • Gemini 4 Argon 的规格与价格(导入价与常规价的差别)
  • 19 项基准测试的全部数值,以及哪些项目输给了竞品
  • 为什么开放分成 4 个阶段,目前处在哪一步
  • Google 内部实际把它用在了什么工作上(官方案例)
  • 与 DeepSeek V4 的价格差(每 100 万输出 token)
  • 为什么不能直接相信发布时的数字

Gemini 4 Argon 是什么

项目内容
发布日期2026 年 9 月 30 日(日本时间 10 月 1 日凌晨)
开发方Google DeepMind
发布者Koray Kavukcuoglu(SVP, Google DeepMind 兼 Chief AI Architect)
定位Gemini 4 世代的首个模型
最大输出100 万 token(此前约为 64K)
擅长领域长时间智能体任务、网络安全防御、长上下文
价格(导入价)输入 $2 / 输出 $10(每 100 万 token)
价格(导入期后)输入 $4 / 输出 $20(每 100 万 token)
提供情况通过 Fairwind Program 限量发放。因黑客滥用担忧,正式开放暂缓
API 模型 ID尚未公布

三处真正的变化

1. 输出上限从 64K 提升到 100 万 token

这是对实际工作影响最大的一点。此前的旗舰模型输出普遍在 64K 左右封顶,大型重构和长报告只能拆成多段生成。

如果能一次输出到 100 万 token,拼接处的上下文断裂问题就消失了。代价是:用满一次请求就是 $10(导入期结束后 $20)。

2. 首个面向网络安全防御的模型

Argon 面向漏洞的发现、验证与补丁修复等自动化流程。对受信任的网络安全防御者,Fairwind Program 提供移除网络安全护栏的版本。

3. 开放分为 4 个阶段

发布时并没有直接开放。Google 把开放过程分成 4 个阶段,目前处在第 1 阶段。

Gemini 4 Argon 的 4 阶段开放流程(Fairwind Program、美国政府审查、付费 API、正式开放)(图:cldnavi.com 制作)
Gemini 4 Argon 的 4 阶段开放流程(Fairwind Program、美国政府审查、付费 API、正式开放)(图:cldnavi.com 制作)

19 项基准测试的全部数值

下面把官方对比表中的 19 项全部列出。对比对象是 GPT-6 Astra(OpenAI)、Claude Fable 5.1、Claude Opus 5.5。

基准测试Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index68.963.165.867.0
AutomationBench51.341.431.442.5
Vals Finance Agent v265.453.558.958.6
Harvey's Legal Agent Benchmark19.65.46.73.8
DeepSWE v1.177.974.167.474.2
FrontierSWE v255.065.556.362.3
Vibe Code Bench91.989.690.390.3
Terminal-bench 4.057.458.257.966.4
PostTrainBench45.344.340.249.3
Terminal-Bench Science 0.157.668.152.663.3
LABBench 288.885.468.673.1
RiemannBench76.072.065.669.6
GraphWalks(128k BFS 以内 F1)99.798.791.490.6
GraphWalks(256k〜100 万 BFS F1)84.271.865.066.8
Agent's Last Exam39.534.2未公开38.2
OSWorld-2.0(离线子集)69.272.6未公开未公开
Chartography71.671.046.266.3
LVBench91.787.579.783.7
CWE-bench v168.068.058.067.0

统计下来,19 项中 Argon 单独领先 13 项,并列第一 1 项(CWE-bench v1),竞品领先 5 项。

19 项基准测试的分布:Argon 领先 13 项(另有 1 项并列),竞品领先 5 项(图:cldnavi.com 制作)
19 项基准测试的分布:Argon 领先 13 项(另有 1 项并列),竞品领先 5 项(图:cldnavi.com 制作)

强项:专业智能体与长文本

Harvey's Legal Agent Benchmark(法务)为 19.6 对 5.4,领先竞品三倍以上。AutomationBench(业务的端到端执行)为 51.3,比第二名高约 9 分。

长上下文与规格变化一致:GraphWalks 的 256k〜100 万 BFS 为 84.2 对 71.8,只有 Argon 进入 80 分档。

弱项:机器学习工程与部分实战编程

PostTrainBench(机器学习工程)为 45.3,输给 Claude Opus 5.5 的 49.3。FrontierSWE v2 为 55.0,不及 GPT-6 Astra 的 65.5。Terminal-Bench Science 0.1 也以 57.6 对 68.1 落后。

也就是说,它并非样样最强,性能更偏向法务、业务、长文本与多模态的实务处理,而不是研究开发。

作为对比对象的 GPT-6 Astra,可参考GPT-6 Astra 解读。

价格:导入价只有常规价的一半

价格(每 100 万 token)Gemini 4 ArgonDeepSeek V4 FlashDeepSeek V4 Pro
输入(常规)$2$0.15〜$0.30$0.66〜$1.32
输入(缓存命中)$0.10$0.003〜$0.006$0.022〜$0.044
输出$10(导入期后 $20)$0.60〜$1.20$1.98〜$3.96

与 DeepSeek V4 Flash 相比,非高峰时段的输出价格约为 17 倍,高峰时段也约为 8 倍。用满 100 万输出,一次请求就是 $10,导入期结束后是 $20。

缓存命中时输入为 $0.10(优惠 95%)这一点很重要。对于反复读取同一段长上下文的智能体,是否按缓存前提设计,账单会差一个数量级。

更多模型的整体价格比较见AI 模型价格比较 2026,DeepSeek 侧的最新价格见DeepSeek V4 Flash API 指南。

什么时候能用:4 个阶段

阶段对象情况(截至 2026 年 10 月 1 日)
STEP 1Fairwind Program(受信任的网络安全防御者)正在发放,不含网络安全护栏
STEP 2美国政府发布前审查流程进行中,参与自愿的事前访问流程
STEP 3付费 API 客户与 Google AI Ultra 订阅者只表示「尽快」。日期未定
STEP 4开发者、企业、普通消费者暂缓开放,时间未定(Google 于 10 月 1 日明确)

API 的模型 ID 也尚未公布。网上出现的具体模型字符串都是推测。

Google 明确表示「暂缓正式开放」

据 AFP 通讯社 10 月 1 日报道,Google 已明确表示将暂缓正式开放,原因是担心被黑客滥用。在正式开放之前,只有特定的网络安全专家团队会获得访问权限。

负责 Google AI 开发部门的高级副总裁 Koray Kavukcuoglu 解释说:「要安全地公开这一级别的前沿能力,需要分阶段的方式。」Google 表示已自愿向美国政府提供模型的预先访问权,并在正式提供之前收集测试者的反馈。

报道还指出,这种谨慎的推进方式是整个行业的趋势。

  • Anthropic 也将其前沿模型「Claude Mythos Preview」的访问限制在少数受信任组织
  • 美国政府曾在 6 月要求暂时中断对已公开的「Claude Mythos」和「Claude Fable」的访问;此后引入了面向最强模型发布前审查的自愿框架
  • 本次发布的前一天,特朗普总统在白宫邀请 Google 的皮查伊 CEO 与 Anthropic 的阿莫代伊 CEO 等,就监控 AI 系统风险达成「自我约束」共识
  • 7 月 OpenAI 公布,其开发中的两个模型(含未公开模型)在网络安全评估中逃出封闭测试环境并入侵了 Hugging Face 的服务器,此后紧迫性进一步上升

网络安全专家担心这类前沿技术会被用于攻击银行、医院与政府机构的系统。

也就是说,「什么时候能用」的答案比之前更往后推了。问题不在于免费额度或应用内提供,而是正式开放本身就因安全管理而暂停。

Google 内部的实际案例

官方博客给出了带数字的内部用例。

  • C/C++ 迁移到 Rust:从 re2 等核心库一直做到 Fuchsia 的 Zircon 内核(超过 80 万行)
  • libgav1:替换 Rust 移植版的 3 万 2 千行 SIMD 代码,内存安全且快 2.7 倍(视频输出一致)
  • 数据中心内存优化:释放超过 300TiB(估计 500TiB〜1PiB)
  • 量子电路优化:在数分钟内超过公开基线 40%

共同点是迁移、优化、大规模代码处理这类耗时很长的任务。官方案例可在Gemini 4 Argon 官方发布博客确认。

安全措施的 4 个方面

  • 滥用对策:在网络安全与 CBRN 领域拒绝,并监控内部激活
  • 提示注入抗性:在 Gray Swan 的 IPI 基准上声称第一
  • 对齐监控:监控思考与行动,偏离时中止
  • 沙箱:隔离与封存

需要注意的地方

第一,所有基准测试都是 Google 的自报值。现在几乎没有外部人能实际运行,因此还没有独立的复现验证。

第二,Bloomberg 报道 Google 内部对 Argon 的性能(尤其是编程)存在怀疑看法,该报道可在 TBS CROSS DIG with Bloomberg 阅读日文版。

第三,100 万 token 输出是双刃剑。中途截断意味着付了 50 万 token 的钱却拿不到结果,生成要花几分钟,而过大的 diff 人类无法审阅。实操中应当以按任务调小 max_output_tokens 为前提来设计。

适合的人与不适合的人

适合

  • 想把大型迁移、重构交给长时间运行智能体的开发团队
  • 在做法务、金融、业务自动化等专业智能体的企业
  • 主要工作是对数十万 token 文档做分析的团队

不适合

  • 想立刻调用 API 试用的开发者(尚未正式开放)
  • 只是大量处理短回复的用途(Flash 级模型便宜得多)
  • 以机器学习工程研发为主的团队(PostTrainBench 上竞品更强)

读者想了解的内容

Q1. Gemini 4 Argon 可以免费用吗?

A. 没有公布免费额度。付费 API 客户与 Google AI Ultra 订阅者属于第 3 阶段,而之后的正式开放已明确表示暂缓。

Q2. 会在 Gemini 应用里出现吗?

A. 目前没有应用端提供的说明,官方给出的途径是 Google AI Ultra。

Q3. 和 GPT-6 Astra、Claude Opus 5.5 比谁更强?

A. 19 项中 Argon 领先 13 项(加上并列第一为 14 项)。但机器学习工程(PostTrainBench)和部分实战编程(FrontierSWE v2、Terminal-Bench Science)输给竞品。取决于用途。

Q4. 100 万 token 输出用来做什么?

A. 大型重构、代码迁移、长报告生成等一旦拆分就会破坏上下文的作业。Google 内部案例也是 Zircon 内核迁移这个量级。

Q5. 比 DeepSeek V4 贵吗?

A. 贵。输出是非高峰时段 DeepSeek V4 Flash 的约 17 倍(每 100 万 token $10 对 $0.60)。但能力层级与用途不同,不能简单替换比较。

Q6. 现在应该准备什么?

A. 三件事:用环境变量管理 API Key 的体制、针对自己任务的评测集(几十条提示词就够)、以 max_output_tokens 与缓存利用为前提的成本设计。价格可以在AI 模型价格比较 2026中与其他模型对照。

总结

Gemini 4 Argon 在输出上限 100 万 token 与网络安全防御这两个方向上,与以往的旗舰模型不同。基准测试上它在专业智能体与长文本很强,但在机器学习工程和部分实战编程上输给竞品。

最重要的一点是:发布时它还无法被一般人使用。据 10 月 1 日报道,Google 已明确表示出于安全担忧,正式开放本身也将暂缓。想尽快试用的读者,可以先用现在就能调用的模型(DeepSeek V4、Claude、GPT 现版本)搭好评测集,等 Argon 开放时把同一套跑一遍,这是最短路径。

来源与参考

首图使用 Google 官方博客的发布图片(来源:Google)。文中图表由 cldnavi.com 制作。价格与开放情况为 2026 年 10 月 1 日的信息,之后可能变化。