2026 年 9 月 30 日发布 · 分阶段开放中

Gemini 4 Argon长篇研究,一次成稿

Google 自 Gemini 3 以来的首款前沿模型,面向跨越长流程的深度推理。输出上限从 64K token 提升到 1M,而 Google 公布的数字里,它领先的是知识工作,不是编程。

Felo API 目前处于内测阶段,Gemini 4 Argon 的接入即将开放。

Gemini 4 Argon 主视觉:蓝色渐变背景上,模型名称与巨大的数字 4 并列
Google 的发布主视觉。Argon 采用全新的命名体系发布,并不是 Gemini 4.0 系列的更新,所以名字里不带版本号。
1M
最大输出 token
从 64K 提升而来,一条生成轨迹就能写完一份完整报告。
2 / 10 美元
API 首发价格
每百万输入 / 输出 token。缓存输入可享 95% 折扣。
77.9%
DeepSWE v1.1
Google 公布的成绩,领先 Claude Opus 5.5 和 GPT-6 Astra。
15%
幻觉率
Artificial Analysis 测得的当前前沿模型最低值。

本页的图片与图表均来自各自的发布机构——Google、Arena.ai 和 Artificial Analysis,并原样呈现,未作任何改动。

开放进度

Argon 尚未全面开放,以下是它的开放顺序。

Google 正分阶段发布 Argon,而第一阶段并不面向公众。Felo 内的接入也在同步准备中。

现已开放

受信任的网络安全防御方

Google Fairwind 计划中的选定合作伙伴可优先获得 Argon,且不附带网络安全防护限制。

接下来公布

付费 API 客户与 Google AI Ultra

Google 称更大范围的开放从这里开始。日期尚未公布,目前仅凭订阅也还无法使用。

尚未排期

开发者、企业与普通用户

排在付费层级之后。Google 尚未承诺全面开放的时间表。

Argon 在 Felo 搜索中的接入正在推进,开放后本页会同步更新。

擅长什么

为写完长任务而生,不是为快速作答

Argon 公布的强项集中在阅读、推理和长文写作上。这跟它常被拿来比较的编程优先型前沿模型,是两条不同的路线。

长任务里不会跑偏的推理

Google 把 Argon 定位在动辄数小时的多步任务上,此前的模型在这类任务中容易偏离目标或提前收尾。

一次输出 1M token

Google 对这次提升的解释是:有足够空间展开思考的模型,可以一条轨迹解决一个难题,而不必来回多轮。

强在知识工作,不是编程

公布差距最大的项目是 Harvey's Legal Agent Benchmark 和 Vals Finance Agent v2,属于真实的法务与财务分析,而不是合成任务。

撑得住的长上下文检索

GraphWalks 测试的是模型能否真正用上 256K 到 1M 的上下文,Google 报告其领先其他旗舰模型 10 个百分点以上。

长视频理解

衡量长视频理解能力的 LVBench 报告成绩为 91.7%,是 Google 为 Argon 列出的最高分。

Harvey's Legal Agent Benchmark 柱状图:Gemini 4 Argon 19.6%,Claude Fable 5.1 6.7%,GPT-6 Astra 5.4%,Claude Opus 5.5 3.8%
长周期法律工作。Argon 的 19.6% 约为第二名模型的三倍,是 Google 公布数据中差距最大的一项。
Vals Finance Agent v2 柱状图:Gemini 4 Argon 65.4%,Claude Fable 5.1 58.9%,Claude Opus 5.5 58.6%,GPT-6 Astra 53.5%
财务研究与分析,65.4% 对 53.5%–58.9% 的群体。领先幅度不及法律工作,但排序一致。

公布数据

在 Google 自家基准上,Argon 处在什么位置

以下均为厂商自报结果。Google 没有说明这些头部成绩对应的思考或 effort 设置,也还没有独立实验室复现。

基准
衡量内容
Argon
最接近的对比
DeepSWE v1.1
长周期软件工程
77.9%
Opus 5.5 为 74.2%,GPT-6 Astra 为 74.1%
CWE-bench v1
发现并修复漏洞
68%
并列第一
AutomationBench
端到端业务任务,来自 Zapier
51.3%
排名第一
LVBench
长视频理解
91.7%
Google 为 Argon 报告的最高分

这些数字只能当作方向参考。厂商基准很少能在生产负载中原样成立,Bloomberg 也报道称,部分 Google 员工自己就怀疑这种跑分领先能否迁移到真实工作。

DeepSWE v1.1 柱状图:Gemini 4 Argon 77.9%,Claude Opus 5.5 74.2%,GPT-6 Astra 74.1%,Claude Fable 5.1 67.4%
长周期软件工程。头部成绩为 77.9%,两个最接近的对手都在 4 个百分点以内。
AutomationBench 柱状图:Gemini 4 Argon 51.3%,Claude Opus 5.5 42.5%,GPT-6 Astra 41.4%,Claude Fable 5.1 31.4%
由 Zapier 打造的端到端业务任务。Argon 越过了 50%,而对比中的其他模型都停留在三十多或四十出头。
CWE-bench v1 排行榜:Gemini 4 Argon、Grok 与 GPT-6 Astra 以 68% 并列,Claude Opus 5.5 为 67%,一路递减至 Inkling 的 37%
Pass@1 下的漏洞发现。Argon 是在拥挤的榜首并列,而不是拉开了差距,上表因此称其为并列第一。
Google 公布的 Gemini 4 Argon 全量结果表,覆盖 16 项基准,分为知识工作、智能体编程、机器学习工程、科学与数学、长上下文、电脑操作、多模态理解、网络安全八组
发布资料中的完整表格,Argon 领先的格子为蓝色,竞争对手领先的格子为灰色。Argon 没有领先的行是 FrontierSWE v2、Terminal-Bench 4.0、PostTrainBench、Terminal-Bench Science 0.1 和 OSWorld-2.0。
Artificial Analysis 的 AA-Omniscience 幻觉率柱状图,覆盖 36 个模型,按从低到高排序:Gemini 4 Argon(High)为 15%,其后是 MiniMax-M3 的 18%、Kimi K2.5 的 26%,一路升到 DeepSeek-V4 Flash 的 96%
这是 Artificial Analysis 的独立测量结果,也是本页唯一一个不由任何厂商提供的数字:它衡量的是每个模型有多常给出错误答案,而不是选择不作答。Argon 的 15% 是图中 36 个模型里最低的,量程上限为 96%。
Arena.ai 的 Text Arena 与 Code Arena: WebDev 排行榜并列展示:Gemini 4 Argon 在 Text Arena 以 1,625 排名第一,在 Code Arena: WebDev 以 1,679 排名第八
上面那段话所依据的两个排名,出自 Arena.ai 的公众投票榜。Argon 在 Text Arena 上榜的 25 个模型中位居榜首;在 Code Arena: WebDev 中排第八,落后于四个 Claude 模型和 OpenAI GPT-6 系列的三款模型。

在 Felo 上

有了能写 1M token 的模型,研究工作流会变成什么样

Felo 把搜索和文档理解放在一起,所以一个长输出模型会改变单次会话能产出多少东西。

以一份文档收尾的调研

先收集资料,再让模型一次写出综述,而不是拆成许多提示词、一段一段拼起来。

一整套文档,一个任务

长上下文检索是 Argon 最强的一项能力,也正是它让合同集、申报文件和长篇报告变得可处理。

需要语感的写作

Argon 公布的画像是文本强、编程中等,适合需要成稿感而不是拼接感的文字团队。

成本

Argon 的价格,以及之后会怎么变

Google 公布了首发价和更高的标价,但没有说明何时切换。做预算时请按高的那个数来。

Token 类型
首发价
之后
输入
2.00 美元 / 百万 token
4.00 美元 / 百万 token
缓存输入
95% 折扣
95% 折扣
输出
10.00 美元 / 百万 token
20.00 美元 / 百万 token

作为参照,首发价大致与 GPT-6.1 Sol 和 Sonnet 5.5 持平,约为 GPT-6 Astra 的五分之一。这些都是标价,不是实测的单任务成本——Argon 回答的问题更难,单次运行仍可能更贵。

在 Felo 上用 Argon 做事的方法

01

把完整的问题带进来

把整套文档或整条长讨论交给 Felo,而不是它的摘要。上下文一旦装不进提示词,Argon 的优势才开始显现。

02

直接要成品

有了 1M token 的输出上限,你可以一条指令要一份完整报告或完整初稿,而不用分章节索取。

03

对着来源核一遍

Felo 会把引用留在答案旁边,一份由模型生成的长文档因此才可复核。

Argon 在 Felo 搜索中的接入正在推进。在开放之前,Felo 模型阵容里的其他模型现在都可以使用。

打开 Felo AI 搜索

Gemini 4 Argon 常见问题

还不能普遍使用。Google 先把 Argon 开放给 Fairwind 计划中的选定合作伙伴,并表示更大范围的开放将从付费 API 客户和 Google AI Ultra 订阅者开始。该阶段没有公布日期,目前仅凭付费订阅也无法获得访问权限。

在 Felo 上试用 Google 的前沿模型

按任务挑模型,用它来搜索、阅读和写作。当 Argon 的开放推进到 Felo 时,它也会加入阵容。

打开 Felo AI 搜索

使用 Felo AI 搜索无需信用卡。