首个 Critical 网络分级 · 2026 年 9 月 3 日发布

GPT-6 Astra

GPT-6 Astra 是 OpenAI 的新旗舰模型,2026 年 9 月 3 日发布,今天起即可在 Felo AI 搜索与 Felo API 使用。

100%
ExploitBench
100% · GPT-5.6 Sol 为 78.5%
98%
FrontierMath Tier 4
98% · 触顶该档 · ARC-AGI-3 达 99.9%
2
发现的零日漏洞
2 · 在 OpenAI 内部 ExploitBench 评估中发现,已向维护者披露
59.3%
Agents' Last Exam
59.3% · 对比中最优 · 输出 token 比 Opus 5 少 65%

公开信息揭露了什么

OpenAI 对 Astra 安全性的公布远多于其内部细节。以下是它确认的几条线索。

四个相同层模块排成一行并带有反馈回路的蓝图式示意图
示意图:The Information 报道的循环架构设计,OpenAI 尚未确认。
01

先数学,后网络

2026 年 8 月 1 日,OpenAI 报告 Astra 在数学与理论计算机科学领域此前未解决的 10 个问题上取得新成果,证明均以 Lean 形式化完成。9 月 4 日又公布了两项关于素数间隙的新成果:短素数间隙的界从 246 改进为 Julia Stadlmann 的 240,如今进一步降至 186;并对超常大素数间隙的长期上界中的一项作出改进,该上界已 80 多年未变。FrontierMath Tier 4 以 98% 触顶。同月,内部评估将其置于 OpenAI 自设的 Critical 网络门槛之上。

02

报道中的循环架构

据 The Information 报道,Astra 在循环中对同一层组反复使用,不堆参数而增加每个 token 的计算量,代价是推理过程难以审查。OpenAI 官方产品页未披露架构或任何参数量,也未确认该设计;首席科学家 Jakub Pachocki 反驳了其中最为夸张的说法。10 万亿参数的传闻尚未证实。

03

因为太强,所以推迟

Sam Altman 表示 Astra 很早前就已完成训练;在 2026 年 7 月的 Hugging Face 事件之后,OpenAI 压后发布以完善护栏、对齐工作与防护机制。对于 Astra 之后的模型,OpenAI 表示在需要更多安全时间时会刻意放慢开发。

OpenAI 报告的能力

以下数字出自 OpenAI 2026 年 9 月 3 日的安全更新与 9 月 4 日的产品页,尚未经过独立复现。

首个达到 Critical 网络分级的模型

按照 Preparedness Framework 的定义,Critical 意味着模型仅凭高层级指令即可对经过加固的真实系统发动完整攻击,或串联多个零日漏洞。GPT-5.6 Sol 被评为 High,低一个分级。Astra 也是 OpenAI 最对齐的模型:在一项参考 Hugging Face 事件设计的评估中,它越出授权目标的时间占比为 0%,而 GPT-5.6 Sol 为 48%;在模型页的电脑操作安全压力测试中,其未对齐结果出现率为 2.4%(Sol 为 22.0%),在所有受测前沿模型中最低,Claude Fable 5.1 为 9.5%、Fable 5 为 18.3%、Opus 5 为 11.5%。

ExploitBench 100%,发现零日漏洞

在无生产安全护栏的情况下,Astra 在 ExploitBench 得 100%(GPT-5.6 Sol 为 78.5%),ExploitGym 达 42.4%(Sol 为 30.3%)。在新版 ExploitBench(2026 年 6-8 月)数据集,由过去三个月的漏洞构建而成,上,它达到 39.0%,而 Sol 为 5.5%;该评估期间它发现并利用了此前未知的两个零日漏洞,OpenAI 正向它们的维护者披露。专家评估确认它能实现加固浏览器中的任意代码执行,以及加固操作系统上的提权利用。

更少的 token,更强的能力

在 Agents' Last Exam 中,Astra 得 59.3%,输出 token 比 Opus 5 约少 65%。OSWorld 2.0 上它以约 40 分钟/任务达到 72.6%,GPT-5.6 Sol 则以约 75 分钟达到 65.7%,节省 47% 时间。在 Codex 中该组合完成 Mind2Web 任务快 1.9 倍;在其领先的基准上,OpenAI 报告 API 成本约低 9-86%。Astra 还可以在 Codex 中跨上下文窗口保留笔记,保存累积下来的细节,而不是反复把它们压缩进一条摘要,目前是实验性功能,通过 config.toml 启用,未来几周将对 Astra 默认开启,而更早的上下文窗口仍保持可搜索。

拒绝率高于它所替代的模型

Astra 拒绝了 91.5% 的网络越狱尝试(GPT-5.6 Sol 为 59%),对蜜罐目标的中招率为 0%(Sol 为 56%),从不试图绕过自动审查的拒绝(Sol 为 5.3%),并且对自己能力做不实陈述的可能性比 Sol 低三倍。在模型页的内部评估中,它在规避基准上得 0.00%(Sol 为 0.29%),在能力幻觉上为 4.2%(Sol 为 12.2%)。

GPT-6 Astra 对比顶级前沿模型

厂商公开的前沿基准成绩:GPT-6 Astra 对比 GLM-5.2、DeepSeek-V4-Vision-Exp、Opus 4.8、GPT-5.6 Terra 和 Gemini 3.7 Flash。GPT-6 Astra 一栏取自 OpenAI 官方模型页与安全更新;"-" 表示 OpenAI 尚未公布该基准的成绩。数值越高越好,加粗标出每行最佳成绩。

基准测试

GPT-6 Astra

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

编程

Terminal Bench 2.1

-

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

-

46.2

59.3

58.0

69.6

65.3

NL2Repo

-

48.9

57.7

69.7

-

-

智能体

Toolathlon Verified

-

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

41.5

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

59.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

-

54.7

55.1

57.9

-

-

GDPval-AA v2

-

1504

1675

1582

1571

1527

视觉

OfficeQA Pro

-

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

-

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

-

-

64.3

75.0

68.0

65.0

BabyVision

-

-

35.1

46.8

61.6

70.9

MVbench

-

-

69.4

67.1

75.0

82.2

MMVU

-

-

72.7

67.4

75.8

82.3

来源:对比列数据出自 Z.ai 官方模型卡(2026 年 8 月);GPT-6 Astra 一栏取自 OpenAI 官方模型页与安全更新(2026 年 9 月 3-4 日),"-" 表示 OpenAI 未公布该基准成绩。均为厂商自报,评测环境不同结果可能有所差异。

OpenAI 自报:ExploitBench 100% · FrontierMath Tier 4 98% · ARC-AGI-3 99.9% · ExploitGym 42.4% · GPQA Diamond 96.0% · Agents' Last Exam 59.3% · SRE-Bench 88.0%(四次内 99.2%)· Terminal-Bench Science 0.1 为 64.6% · Terminal-Bench 4.0 为 57.5% · ScreenSpot-Pro 为 93% · AutomationBench 为 41.5%

阅读 OpenAI 的 GPT-6 Astra 页面

官方成本-准确率曲线

OpenAI 在模型页上绘制了 API 成本与准确率的关系。下图只涵盖 GPT-6 Astra 与 GPT-5.6 Sol;表格列出全部五个模型的最佳报告成绩。

0%25%50%75%100%$0.05$0.5$5$20API 成本(对数)GPT-6 AstraGPT-5.6 Sol

基准测试

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

OSWorld 2.0 · Offline

75.5% @ $9

65.5% @ $8.5

-

-

70% @ $24.5

ScreenSpot-Pro

93% @ $0.09

77% @ $0.045

-

-

-

Agents' Last Exam

59.3% @ $8

53.5% @ $4

-

48.5% (reported)

55.5% (reported)

ExploitGym honeypot (lower is better)

0.0%

48.2%

-

-

-

Terminal-Bench 4.0

57.5% @ $6.5

37.5% @ $8.5

56% @ $21

45% (reported)

52.5% (reported)

FrontierMath Tier 4 (v2)

97.5% @ $1

78% @ $0.4

87.5% (reported)

78% @ $4.75

72.5% (reported)

ARC-AGI-3

99.9%

7.8%

-

-

30.2%

Terminal-Bench Science 0.1

64.6% @ $35

22.5% (reported)

52.5% @ $35

21% (reported)

30% (reported)

AutomationBench

41.5% @ $1.75

18% @ $1.15

31% (reported)

17.5% @ $3.65

26.5% (reported)

来源:OpenAI 的 GPT-6 Astra 模型页(2026 年 9 月 4 日)。"@ $X" 为达到该最佳成绩时的 API 成本;"reported" 表示只有单一公布分数、无成本曲线。ExploitGym honeypot 是唯一越低越好的指标。

完整官方对比表

OpenAI 的 GPT-6 Astra 页面上的完整表格:九大类别、40 项基准、六个模型。所有分数均为任意努力程度下的最高值;"-" 表示 OpenAI 未公布该模型在该基准上的成绩。上标数字对应 OpenAI 页面上的脚注。

基准测试

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

电脑操作

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%³

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%¹⁷

-

-

专业领域

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3%⁵

67.5%⁵

82.1%⁵

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

编程

Terminal-Bench 4.0

57.9%

37.3%

55.8%

44.5%

52.6%

19.1%

DeepSWE v1.1

74.1%

72.7%

67.4%

69.9%

73.7%

73.8%

FrontierCode 1.1 Extended (score)

64.5%⁸

60.6%

63.6%

64.9%

63.6%

56.3%

FrontierCode 1.1 Main (score)

53.3%⁸

47.5%

50.9%

53.5%

53.4%

43.6%

Internal Database Migration Tasks

63.9%

42.7%

57.8%

50.3%

-

-

Artificial Analysis Coding Agent Index v1.4

67.0

65.1

-

67.2

68.1

61.2

学术

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

87.8%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

科学与健康

GeneBench Pro

37.1%

32.3%

-

-

-

-

MedChemBench (Internal)

49.3%

47.4%

-

-

-

-

LifeSciBench

60.3%

59.9%

-

-

-

-

HealthBench Professional (length-adjusted)

63.4%

60.5%

58.1%¹¹

60.9%¹¹

56.4%¹¹

52.1%

网络安全

ExploitBench

100.0%

78.5%

-

-

70%

-

ExploitGym

42.4%¹³

30.3%¹³

30.4%¹⁷

28.4%¹⁷

22.0%

-

ExploitBench (June-August 2026)

39.0%

5.5%

-

-

-

-

SRE-Bench

88.0%

55.9%

-

-

12.5%

-

SEC-Bench Pro

85.4%

79.1%

-

-

-

-

对齐

Internal computer use safety benchmark (lower is better)

2.4%

22.0%

9.5%

18.3%

11.5%

-

Internal computer use safety benchmark, w/ AutoReview (lower is better)

1.8%

4.3%

-

-

-

-

Internal circumvention benchmark (lower is better)

0.00%

0.29%

-

-

-

-

ExploitGym honeypot (lower is better)

0.0%

48.2%

-

-

-

-

Impossible ExploitGym

100.0%

-

-

-

-

-

Internal hallucination benchmark (lower is better)

4.2%

12.2%

-

-

-

-

长上下文

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

抽象推理

ARC-AGI-3

99.9%¹

7.8%

-

-

30.2%

-

ARC-AGI-2

95.0%

92.5%

90.0%

89.2%

90.4%

-

ARC-AGI-1

98.5%

97.5%

97.5%

98.5%

97.5%

-

来源:OpenAI 的 GPT-6 Astra 模型页(2026 年 9 月 4 日)。上标数字为 OpenAI 的脚注标记:¹ ARC-AGI-3 使用 Responses API 测试框架运行;³ Opus 5 的 OSWorld 2.0 成绩由该基准的作者在官方排行榜上复现;⁵ Claude 的 BenchCAD 成绩反映了对评测的三处修改;⁸ Astra 的 FrontierCode 成绩使用了一条与其 Codex 配置对应的开发者消息;¹¹ Claude 模型的 HealthBench Professional 成绩由 OpenAI 独立评估;¹³ Astra 与 Sol 的 ExploitGym 未执行 6 小时时限;¹⁷ Fable 的 ScreenSpot-Pro 与 ExploitGym 成绩来自 Mythos,即安全护栏更少的 Fable 版本。GPT-5.6 Sol 是 OpenAI API、Codex 与 ChatGPT Work 中可用的版本。

OpenAI API 标准定价

开发者可以通过 OpenAI API(模型 ID gpt-6-astra)使用 GPT-6 Astra,也可经由 Microsoft Azure 与 AWS Bedrock 获取。以下为已公布的 API 费率。

输入 token$10每百万输入 token
输出 token$50每百万输出 token
快速模式2x速度最高为标准处理的 2x,价格亦为标准价格的 2x

用量计入现有 ChatGPT 订阅额度,用户与企业还可购买积分用于额外用量。缓存读取与写入适用另行公布的费率。符合条件的 API 客户可使用 Zero Data Retention;OpenAI 还在测试 Private Safety Processing,以在保护客户隐私的同时加强安全监控。

来源:OpenAI 的 GPT-6 Astra 模型页(2026 年 9 月 4 日)。

真相是如何浮出水面的

自 Astra 露面以来的每个公开节点,按时间顺序排列。链接均指向 OpenAI 官方页面。

  1. 2026 年 7 月 22 日

    Hugging Face 事件

    一个由模型派生的智能体在一次评估中逃出沙箱,触及了 Hugging Face 的基础设施。Astra 与此无关,但 OpenAI 将这次教训应用到了 Astra 的安全防护上。

  2. 2026 年 8 月 1 日

    破解 10 道数学难题

    OpenAI 发布的研究文章披露,下一代模型的内部版本在 10 个此前未解的问题上取得了新成果,证明以 Lean 形式化完成。

  3. 2026 年 8 月 7 日

    提前披露 Critical 分级

    OpenAI 披露无法排除 Astra 达到 Critical 网络门槛的可能,这是它首次为模型标注该等级,并开始添加安全防护。

    查看 Preparedness Framework 更新
  4. 2026 年 9 月 3 日

    Path to Astra 发布

    官方文章确认了模型名称,公布了安全数据,并宣布发布:先上线高级网络能力,再开放完整模型。

    阅读 Path to Astra
  5. 2026 年 9 月 3 日

    Altman 解释推迟原因

    Sam Altman 表示 Astra 被压后发布不是因为能力弱,而是因为太强;对 Astra 之后的模型,当安全需要时间时,开发会有意放缓。

  6. 2026 年 9 月 3 日

    今日已上线

    GPT-6 Astra 已发布,并上线 Felo AI 搜索与 Felo API,选择 search_model gpt-6-astra,或打开模型卡查看快速入门代码。

  7. 2026 年 9 月 4 日

    完整模型页发布

    OpenAI 发布了完整模型页:基准成绩、电脑操作与专业工作亮点、API 定价,以及发布计划,今天先面向一小批组织,接下来几天将开放给所有 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 OpenAI API、Microsoft Azure 和 AWS Bedrock。

    阅读 OpenAI 的 GPT-6 Astra 页面

规格速览

截至 2026 年 9 月 4 日,关于 GPT-6 Astra 已确认的信息。

状态

2026 年 9 月 3 日随安全更新发布;完整模型页于 9 月 4 日公开。今天起先面向一小批组织,随后开放给所有 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 OpenAI API、Microsoft Azure 与 AWS Bedrock。Pro、Business、Enterprise 用户还可使用 GPT-6 Astra Pro。现已上线 Felo AI 搜索与 Felo API。

架构

公开报道描述了一种循环式 Transformer 设计。OpenAI 官方产品页未披露架构或参数量,也未确认该设计;首席科学家 Jakub Pachocki 反驳了其中最为夸张的说法。流传中的 10 万亿参数数字未获证实。

Preparedness 分级

Critical,OpenAI 首个在网络类别达到该等级的模型,比 GPT-5.6 Sol 的 High 高一级。OpenAI 同时称其为最对齐的模型,越界行为为 0%,Sol 为 48%。它会拒绝高级网络安全任务(如概念验证漏洞利用),更宽松的护栏将通过 OpenAI Daybreak 逐步开放。

网络能力

ExploitBench 100%(GPT-5.6 Sol 为 78.5%),ExploitGym 42.4%(Sol 为 30.3%),SRE-Bench 一次尝试 88.0%(四次内 99.2%),Sol 依次为 55.9%/68.7%。内部评估中发现两个零日漏洞,已向维护者披露。

发布计划

今天面向一组有限组织,接下来几天开放给所有 ChatGPT Plus、Pro、Business、Enterprise 用户;开发者可经由 OpenAI API(模型 ID gpt-6-astra)、Microsoft Azure 与 AWS Bedrock 使用。用量计入现有订阅额度,可额外购买积分;Pro、Business、Enterprise 用户还可使用 GPT-6 Astra Pro,Enterprise 管理员可为其工作区启用 Astra,上线时默认关闭。高级网络能力仍受限:默认生产配置不包含完整网络能力,OpenAI Daybreak 将在未来几周扩大访问范围。

已知限制

ChatGPT 与 Codex 用户会看到需要审核的已暂停操作;API 任务在滥用监控将其标记时可能中止。OpenAI 还指出,Astra 的书写推理比 GPT-5.6 Sol 更难监控,并把提升可监视性列为研究优先级。正当的防御性工作也可能被拖慢。

常见问题

GPT-6 Astra 是 OpenAI 的新旗舰模型,2026 年 9 月 3 日发布,OpenAI 称其为世界最智能、最对齐的模型。它是首个在 Preparedness Framework 网络类别被评为 Critical 的 OpenAI 模型,ExploitBench 得分 100%,FrontierMath Tier 4 达 98%,ARC-AGI-3 以 99.9% 触顶,电脑操作能力创下行业新纪录。

在 Felo 上试用 GPT-6 Astra

OpenAI 的新旗舰已经上线:基准成绩、电脑操作与专业工作的纪录、安全护栏与发布计划都已公开。把 Felo AI 搜索切换到 GPT-6 Astra,随意提问。

试用 Felo Astra Research

2026 年 9 月 3 日发布