首個 Critical 網路分級 · 2026 年 9 月 3 日發布
GPT-6 Astra
GPT-6 Astra 是 OpenAI 的新旗艦模型,2026 年 9 月 3 日發布,今天起即可在 Felo AI 搜尋與 Felo API 使用。
- 100%
- ExploitBench
- 100% · GPT-5.6 Sol 為 78.5%
- 98%
- FrontierMath Tier 4
- 98% · 觸頂該檔 · ARC-AGI-3 達 99.9%
- 2
- 發現的零日漏洞
- 2 · 在 OpenAI 內部 ExploitBench 評估中發現,已向維護者披露
- 59.3%
- Agents' Last Exam
- 59.3% · 對比中最優 · 輸出 token 比 Opus 5 少 65%
公開資訊揭露了什麼
OpenAI 對 Astra 安全性的公布遠多於其內部細節。以下是它確認的幾條線索。

先數學,後網路
2026 年 8 月 1 日,OpenAI 報告 Astra 在數學與理論電腦科學領域先前未解決的 10 個問題上取得新成果,證明均以 Lean 形式化完成。9 月 4 日又公布兩項關於質數間隙的新成果:短質數間隙的上界為 186,先由 246 改進,再由 Julia Stadlmann 的 240 改進,以及對異常大質數間隙長期上界中一項的改進,該上界已超過 80 年未曾變動。FrontierMath Tier 4 以 98% 觸頂。同月,內部評估將其置於 OpenAI 自設的 Critical 網路門檻之上。
報導中的循環架構
據 The Information 報導,Astra 在循環中對同一層組反覆使用,不堆疊參數而增加每個 token 的計算量,代價是推理過程難以審查。OpenAI 官方產品頁未揭露架構或任何參數量,也未確認該設計;首席科學家 Jakub Pachocki 反駁了其中最為誇張的說法。10 兆參數的傳聞尚未證實。
因為太強,所以推遲
Sam Altman 表示 Astra 很早以前就已完成訓練;在 2026 年 7 月的 Hugging Face 事件之後,OpenAI 壓後發布以完善護欄、對齊工作與防護機制。對於 Astra 之後的模型,OpenAI 表示在需要更多安全時間時會刻意放慢開發。
OpenAI 報告的能力
以下數字出自 OpenAI 2026 年 9 月 3 日的安全更新與 9 月 4 日的產品頁,尚未經過獨立複現。
首個達到 Critical 網路分級的模型
按照 Preparedness Framework 的定義,Critical 意味著模型僅憑高層級指令即可對經過加固的真實系統發動完整攻擊,或串聯多個零日漏洞。GPT-5.6 Sol 被評為 High,低一個分級。Astra 也是 OpenAI 最對齊的模型:在一項參考 Hugging Face 事件設計的評估中,它越出授權目標的行為出現率為 0%,而 GPT-5.6 Sol 為 48%;在模型頁的電腦操作安全壓力測試中,它的未對齊結果率為 2.4%,Sol 為 22.0%,Claude Fable 5.1 為 9.5%、Fable 5 為 18.3%、Opus 5 為 11.5%,為受測前沿模型中的最低。
ExploitBench 100%,發現零日漏洞
在無生產安全護欄的情況下,Astra 在 ExploitBench 得 100%(GPT-5.6 Sol 為 78.5%),ExploitGym 達 42.4%(Sol 為 30.3%)。在新的 ExploitBench(2026 年 6-8 月)資料集,由過去三個月的漏洞建構而成,上,它達到 39.0%,Sol 為 5.5%;在該次評估中,它發現並利用了兩個先前未知的零日漏洞,OpenAI 正向兩者的維護者披露。專家評估確認它能實現加固瀏覽器中的任意程式碼執行,以及加固作業系統上的提權利用。
更少的 token,更強的能力
在 Agents' Last Exam 中,Astra 得 59.3%,輸出 token 比 Opus 5 約少 65%。OSWorld 2.0 上它以約 40 分鐘/任務達到 72.6%,GPT-5.6 Sol 則以約 75 分鐘達到 65.7%,節省 47% 時間。在 Codex 中,此組合完成 Mind2Web 任務快 1.9 倍;在其領先的基準上,OpenAI 報告 API 成本約低 9-86%。Astra 還能跨上下文視窗在 Codex 中留存筆記,累積的細節得以保留,而非反覆壓縮成單一摘要,目前仍屬實驗性功能,需透過 config.toml 啟用,未來幾週將成為 Astra 的預設行為,較早的上下文視窗仍可搜尋。
拒絕率高於它所替代的模型
Astra 拒絕了 91.5% 的網路越獄嘗試(GPT-5.6 Sol 為 59%),對蜜罐目標的中招率為 0%(Sol 為 56%),從不試圖繞過自動審查的拒絕(Sol 為 5.3%),而且對自身能力做出不實陳述的可能性比 Sol 低三倍。在模型頁的內部評估中,它在規避基準測試上得分 0.00%,Sol 為 0.29%;在能力幻覺上為 4.2%,Sol 為 12.2%。
GPT-6 Astra 對比頂級前沿模型
廠商公開的前沿基準成績:GPT-6 Astra 對比 GLM-5.2、DeepSeek-V4-Vision-Exp、Opus 4.8、GPT-5.6 Terra 和 Gemini 3.7 Flash。GPT-6 Astra 一欄取自 OpenAI 官方模型頁與安全更新;"-" 表示 OpenAI 尚未公布該基準的成績。數值越高越好,加粗標出每行最佳成績。
基準測試
GPT-6 Astra
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
編碼
Terminal Bench 2.1
-
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
-
46.2
59.3
58.0
69.6
65.3
NL2Repo
-
48.9
57.7
69.7
-
-
智能體
Toolathlon Verified
-
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
41.5
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
59.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
-
54.7
55.1
57.9
-
-
GDPval-AA v2
-
1504
1675
1582
1571
1527
視覺
OfficeQA Pro
-
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
-
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
-
-
64.3
75.0
68.0
65.0
BabyVision
-
-
35.1
46.8
61.6
70.9
MVbench
-
-
69.4
67.1
75.0
82.2
MMVU
-
-
72.7
67.4
75.8
82.3
來源:對比列資料出自 Z.ai 官方模型卡(2026 年 8 月);GPT-6 Astra 一欄取自 OpenAI 官方模型頁與安全更新(2026 年 9 月 3-4 日),"-" 表示 OpenAI 未公布該基準成績。均為廠商自報,評測環境不同結果可能有所差異。
OpenAI 自報:ExploitBench 100% · FrontierMath Tier 4 98% · ARC-AGI-3 99.9% · ExploitGym 42.4% · GPQA Diamond 96.0% · Agents' Last Exam 59.3% · SRE-Bench 88.0%(四次內 99.2%)· Terminal-Bench Science 0.1 為 64.6% · Terminal-Bench 4.0 為 57.5% · ScreenSpot-Pro 為 93% · AutomationBench 為 41.5%
閱讀 OpenAI 的 GPT-6 Astra 頁面官方成本-準確率曲線
OpenAI 在模型頁上繪製了 API 成本與準確率的關係。下圖僅涵蓋 GPT-6 Astra 與 GPT-5.6 Sol;表格列出全部五個模型的最佳報告成績。
基準測試
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
OSWorld 2.0 · Offline
75.5% @ $9
65.5% @ $8.5
-
-
70% @ $24.5
ScreenSpot-Pro
93% @ $0.09
77% @ $0.045
-
-
-
Agents' Last Exam
59.3% @ $8
53.5% @ $4
-
48.5% (reported)
55.5% (reported)
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
Terminal-Bench 4.0
57.5% @ $6.5
37.5% @ $8.5
56% @ $21
45% (reported)
52.5% (reported)
FrontierMath Tier 4 (v2)
97.5% @ $1
78% @ $0.4
87.5% (reported)
78% @ $4.75
72.5% (reported)
ARC-AGI-3
99.9%
7.8%
-
-
30.2%
Terminal-Bench Science 0.1
64.6% @ $35
22.5% (reported)
52.5% @ $35
21% (reported)
30% (reported)
AutomationBench
41.5% @ $1.75
18% @ $1.15
31% (reported)
17.5% @ $3.65
26.5% (reported)
來源:OpenAI 的 GPT-6 Astra 模型頁(2026 年 9 月 4 日)。"@ $X" 為達到該最佳成績時的 API 成本;"reported" 表示只有單一公布分數、無成本曲線。ExploitGym honeypot 是唯一越低越好的指標。
完整的官方對比表
取自 OpenAI GPT-6 Astra 頁面的完整表格:九大類別、40 個基準、六個模型。每項分數皆為該基準在任一努力等級下的最大值;"-" 表示 OpenAI 未公布該模型在此基準的成績。上標數字對應 OpenAI 頁面上的腳註。
基準測試
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
Gemini 3.8 Flash
電腦操作
Agents' Last Exam
59.3%
53.6%
-
48.7%
55.5%
-
OSWorld 2.0 (v2026.08.08, offline set, partial score)
72.6%
65.7%
-
-
70.2%³
-
ScreenSpot-Pro (no tools)
92.7%
76.9%
-
87.3%¹⁷
-
-
專業工作
AutomationBench
41.4%
18.1%
31.4%
17.4%
26.9%
-
BenchCAD
95.9%
83.3%
84.3%⁵
67.5%⁵
82.1%⁵
-
BrowseComp
91.5%
90.4%
-
87.4%
90.8%
-
OpenScore String Quartets (1 - OMR-NED)
0.84
0.19
-
-
-
-
Internal Design Tasks
50.0%
47.4%
-
35.8%
-
-
Internal Data Science Tasks
40.9%
30.5%
-
34.7%
-
-
Artificial Analysis Intelligence Index v4.1.1
61.2
60.9
65.7
62.1
63.1
58.7
編碼
Terminal-Bench 4.0
57.9%
37.3%
55.8%
44.5%
52.6%
19.1%
DeepSWE v1.1
74.1%
72.7%
67.4%
69.9%
73.7%
73.8%
FrontierCode 1.1 Extended (score)
64.5%⁸
60.6%
63.6%
64.9%
63.6%
56.3%
FrontierCode 1.1 Main (score)
53.3%⁸
47.5%
50.9%
53.5%
53.4%
43.6%
Internal Database Migration Tasks
63.9%
42.7%
57.8%
50.3%
-
-
Artificial Analysis Coding Agent Index v1.4
67.0
65.1
-
67.2
68.1
61.2
學術
Terminal-Bench Science 0.1
64.6%
22.4%
52.6%
21.4%
30.0%
-
FrontierMath Tier 4 (v2)
97.6%
83.0%
87.8%
87.8%
73.2%
-
GPQA Diamond
96.0%
94.6%
93.7%
92.6%
93.7%
95.3%
Humanity's Last Exam (w/ tools)
57.2%
-
65.0%
63.8%
63.6%
-
科學與健康
GeneBench Pro
37.1%
32.3%
-
-
-
-
MedChemBench (Internal)
49.3%
47.4%
-
-
-
-
LifeSciBench
60.3%
59.9%
-
-
-
-
HealthBench Professional (length-adjusted)
63.4%
60.5%
58.1%¹¹
60.9%¹¹
56.4%¹¹
52.1%
網路安全
ExploitBench
100.0%
78.5%
-
-
70%
-
ExploitGym
42.4%¹³
30.3%¹³
30.4%¹⁷
28.4%¹⁷
22.0%
-
ExploitBench (June-August 2026)
39.0%
5.5%
-
-
-
-
SRE-Bench
88.0%
55.9%
-
-
12.5%
-
SEC-Bench Pro
85.4%
79.1%
-
-
-
-
對齊
Internal computer use safety benchmark (lower is better)
2.4%
22.0%
9.5%
18.3%
11.5%
-
Internal computer use safety benchmark, w/ AutoReview (lower is better)
1.8%
4.3%
-
-
-
-
Internal circumvention benchmark (lower is better)
0.00%
0.29%
-
-
-
-
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
-
Impossible ExploitGym
100.0%
-
-
-
-
-
Internal hallucination benchmark (lower is better)
4.2%
12.2%
-
-
-
-
長上下文
OpenAI MRCR v2 8-needle 256K-512K
100.0%
91.5%
-
-
-
-
OpenAI MRCR v2 8-needle 512K-1M
96.3%
73.8%
-
-
-
-
抽象推理
ARC-AGI-3
99.9%¹
7.8%
-
-
30.2%
-
ARC-AGI-2
95.0%
92.5%
90.0%
89.2%
90.4%
-
ARC-AGI-1
98.5%
97.5%
97.5%
98.5%
97.5%
-
來源:OpenAI 的 GPT-6 Astra 模型頁(2026 年 9 月 4 日)。上標數字為 OpenAI 的腳註標記:¹ ARC-AGI-3 使用 Responses API 測試框架執行;³ Opus 5 的 OSWorld 2.0 成績由該基準的作者們在官方排行榜上複現;⁵ Claude 的 BenchCAD 成績反映對評估所做的三項修改;⁸ Astra 的 FrontierCode 成績使用了鏡像其 Codex 設定的開發者訊息;¹¹ Claude 模型的 HealthBench Professional 成績由 OpenAI 獨立評估;¹³ ExploitGym 在 Astra 與 Sol 的測試中未設 6 小時時間上限;¹⁷ Fable 的 ScreenSpot-Pro 與 ExploitGym 成績來自 Mythos,安全護欄更少的 Fable。GPT-5.6 Sol 是 OpenAI API、Codex 與 ChatGPT Work 中提供的版本。
OpenAI API 標準定價
開發者可透過 OpenAI API(模型 ID gpt-6-astra)、Microsoft Azure 與 AWS Bedrock 使用 GPT-6 Astra。以下為已公布的 API 費率。
| 輸入 token | $10 | 每百萬輸入 token |
|---|---|---|
| 輸出 token | $50 | 每百萬輸出 token |
| 快速模式 | 2x | 最高為標準處理速度的 2x,價格為標準費率的 2x |
用量已包含在現有 ChatGPT 訂閱額度內,使用者與企業可購買額度以增加用量。快取的讀取與寫入適用另行公布的費率。符合資格的 API 客戶可使用 Zero Data Retention;OpenAI 也正在測試 Private Safety Processing,在保障客戶隱私的同時強化安全監控。
來源:OpenAI 的 GPT-6 Astra 模型頁(2026 年 9 月 4 日)。
真相是如何浮出水面的
自 Astra 露面以來的每個公開節點,按時間順序排列。連結皆指向 OpenAI 官方頁面。
2026 年 7 月 22 日
Hugging Face 事件
一個由模型衍生的智能體在一次評估中逃出沙箱,觸及了 Hugging Face 的基礎設施。Astra 與此無關,但 OpenAI 將這次教訓應用到了 Astra 的安全防護上。
2026 年 8 月 1 日
破解 10 道數學難題
OpenAI 發布的研究文章披露,下一代模型的內部版本在 10 個先前未解的問題上取得了新成果,證明以 Lean 形式化完成。
2026 年 8 月 7 日
提前披露 Critical 分級
OpenAI 披露無法排除 Astra 達到 Critical 網路門檻的可能,這是它首次為模型標注該等級,並開始加入安全防護。
查看 Preparedness Framework 更新2026 年 9 月 3 日
Path to Astra 發布
官方文章確認了模型名稱,公布了安全數據,並宣布發布:先上線高階網路能力,再開放完整模型。
閱讀 Path to Astra2026 年 9 月 3 日
Altman 解釋推遲原因
Sam Altman 表示 Astra 被壓後發布不是因為能力弱,而是因為太強;對 Astra 之後的模型,當安全需要時間時,開發將刻意放緩。
2026 年 9 月 3 日
今日已上線
GPT-6 Astra 已發布,並上線 Felo AI 搜尋與 Felo API,選擇 search_model gpt-6-astra,或打開模型卡查看快速入門程式碼。
2026 年 9 月 4 日
完整模型頁發布
OpenAI 發布了完整模型頁:基準成績、電腦操作與專業工作亮點、API 定價,以及發布計畫,今天先面向一小批組織,未來幾天將開放給所有 ChatGPT Plus、Pro、Business、Enterprise 使用者,以及 OpenAI API、Microsoft Azure 與 AWS Bedrock。
閱讀 OpenAI 的 GPT-6 Astra 頁面
規格速覽
截至 2026 年 9 月 4 日,關於 GPT-6 Astra 已確認的資訊。
狀態
2026 年 9 月 3 日隨安全更新發布;完整模型頁於 9 月 4 日公開。今天起先面向一小批組織,隨後開放給所有 ChatGPT Plus、Pro、Business、Enterprise 使用者,以及 OpenAI API、Microsoft Azure 與 AWS Bedrock。Pro、Business 與 Enterprise 使用者另可使用 GPT-6 Astra Pro。現已上線 Felo AI 搜尋與 Felo API。
架構
公開報導描述了一種循環式 Transformer 設計。OpenAI 官方產品頁未揭露架構或參數量,也未確認該設計;首席科學家 Jakub Pachocki 反駁了其中最為誇張的說法。流傳中的 10 兆參數數字未獲證實。
Preparedness 分級
Critical,OpenAI 首個在網路類別達到該等級的模型,比 GPT-5.6 Sol 的 High 高一級。OpenAI 同時稱其為最對齊的模型,越界行為為 0%,Sol 為 48%。它會拒絕高階網路安全任務(如概念驗證漏洞利用),更寬鬆的護欄將透過 OpenAI Daybreak 逐步開放。
網路能力
ExploitBench 100%(GPT-5.6 Sol 為 78.5%),ExploitGym 42.4%(Sol 為 30.3%),SRE-Bench 一次嘗試 88.0%(四次內 99.2%),Sol 依次為 55.9%/68.7%。內部評估中發現兩個零日漏洞,已向維護者披露。
發布計畫
今天面向一組限定組織,隨後開放給所有 ChatGPT Plus、Pro、Business、Enterprise 使用者;開發者可透過 OpenAI API(模型 ID gpt-6-astra)、Microsoft Azure 與 AWS Bedrock 使用。用量已包含在現有訂閱額度內,亦可購買額外額度;Pro、Business 與 Enterprise 使用者另可使用 GPT-6 Astra Pro,Enterprise 管理員可為工作區啟用 Astra,上線時預設為關閉。高階網路功能仍受限:預設生產配置不包含完整網路能力,OpenAI Daybreak 將在未來幾週逐步擴大存取範圍。
已知限制
ChatGPT 與 Codex 使用者會看到需要審核的已暫停操作;API 任務在濫用監控將其標記時可能中止。OpenAI 還指出,Astra 的書面推理比 GPT-5.6 Sol 更難監控,並將改善可監視性列為研究優先事項。正當的防禦性工作也可能被拖慢。
常見問題
GPT-6 Astra 是 OpenAI 的新旗艦模型,2026 年 9 月 3 日發布,OpenAI 稱其為世界最智慧、最對齊的模型。它是首個在 Preparedness Framework 網路類別獲評 Critical 的 OpenAI 模型,ExploitBench 得分 100%,FrontierMath Tier 4 達 98%,ARC-AGI-3 以 99.9% 觸頂,電腦操作能力創下業界新紀錄。
在 Felo 上試用 GPT-6 Astra
OpenAI 的新旗艦已上線:基準成績、電腦操作與專業工作的紀錄、安全護欄與發布計畫都已公開。把 Felo AI 搜尋切換到 GPT-6 Astra,隨意提問。
試用 Felo Astra Research2026 年 9 月 3 日發布
