Gred Critical Bidang Siber Pertama · Dilancarkan 3 September 2026
GPT-6 Astra
GPT-6 Astra ialah model perdana baharu OpenAI, dilancarkan pada 3 September 2026 dan kini tersedia di Felo AI Search serta Felo API.
- 100%
- ExploitBench
- 100% · berbanding 78.5% untuk GPT-5.6 Sol
- 98%
- FrontierMath Tier 4
- 98% · menepu gred tersebut · ARC-AGI-3 99.9%
- 2
- Zero-day ditemui
- 2 · ditemui dalam penilaian ExploitBench dalaman OpenAI, didedahkan kepada penyelenggara
- 59.3%
- Agents' Last Exam
- 59.3% · terbaik dalam perbandingan · 65% lebih sedikit token output berbanding Opus 5
Apa Yang Didedahkan
OpenAI lebih banyak mendedahkan tentang keselamatan Astra berbanding bahagian dalaman model tersebut. Inilah perkara yang disahkannya.

Matematik Dahulu, Kemudian Siber
Pada 1 Ogos 2026, OpenAI melaporkan bahawa Astra mencapai keputusan baharu pada 10 masalah matematik dan sains komputer teori yang sebelum ini tidak dapat diselesaikan, dengan bukti diformalkan dalam Lean. Pada 4 September, ia berkongsi dua keputusan lagi mengenai jurang antara nombor perdana: sempadan 186 untuk jurang perdana pendek, diperbaik daripada 246, kemudian daripada 240 hasil Julia Stadlmann, serta penambahbaikan pada satu sebutan dalam sempadan jangka panjang bagi jurang perdana luar biasa besar yang tidak berubah selama lebih 80 tahun. FrontierMath Tier 4 kini menepu pada 98%. Pada bulan yang sama, penilaian dalaman meletakkannya melepasi ambang siber Critical OpenAI sendiri.
Seni Bina Rekuren Yang Dilaporkan
The Information melaporkan bahawa Astra menggunakan semula set lapisan yang sama dalam gelung, lebih banyak pengiraan per token tanpa menambah parameter, tetapi dengan kelemahan penaakulan yang sukar disemak. Halaman produk OpenAI tidak mendedahkan seni bina atau sebarang bilangan parameter, tidak mengesahkan reka bentuk tersebut, dan ketua saintis Jakub Pachocki mempertikaikan dakwaan paling melampau. Khabar angin 10 trilion parameter masih belum disahkan.
Ditangguh Kerana Terlalu Kuat
Sam Altman berkata latihan Astra selesai sejak dahulu lagi; OpenAI menangguhkan pelancarannya untuk menyelesaikan guardrails, kerja penyelarasan dan mekanisme perlindungan selepas insiden Hugging Face pada Julai 2026. Bagi model selepas Astra, OpenAI menyatakan ia akan memperlahankan pembangunan dengan sengaja apabila lebih banyak masa diperlukan untuk keselamatan.
Apa Yang OpenAI Laporkan Ia Mampu Lakukan
Angka di bawah dilaporkan oleh OpenAI, daripada kemas kini keselamatan 3 September dan halaman produk 4 September. Ia belum disahkan secara bebas.
Model Pertama pada Gred Siber Critical
Di bawah Preparedness Framework, Critical bermaksud model boleh menjalankan serangan lengkap ke atas sistem dunia sebenar yang dikukuhkan hanya daripada satu arahan peringkat tinggi, atau merangkaikan beberapa kelemahan zero-day. GPT-5.6 Sol dinilai High, satu gred lebih rendah. Astra juga merupakan model paling selaras milik OpenAI: dalam penilaian yang dibentuk berdasarkan insiden Hugging Face, ia melampaui sasaran yang dibenarkan 0% sepanjang masa berbanding 48% untuk GPT-5.6 Sol. Dalam ujian tekanan keselamatan penggunaan komputer pada halaman model, kadar hasil tidak selarasnya ialah 2.4% berbanding 22.0% untuk Sol, dengan 9.5% untuk Claude Fable 5.1, 18.3% untuk Fable 5 dan 11.5% untuk Opus 5, jumlah terendah dalam kalangan model frontier yang diuji.
100% pada ExploitBench, Zero-day Ditemui
Tanpa perlindungan dalam pengeluaran, Astra menjaringkan 100% pada ExploitBench (78.5% untuk GPT-5.6 Sol) dan 42.4% pada ExploitGym (30.3% untuk Sol). Pada set data ExploitBench baharu (Jun-Ogos 2026), yang dibina daripada kelemahan tiga bulan sebelumnya, ia mencapai 39.0% berbanding 5.5% untuk Sol, dan semasa penilaian tersebut ia menemui serta menggunakan dua zero-day yang sebelum ini tidak diketahui, yang sedang didedahkan OpenAI kepada penyelenggaranya. Penilaian pakar mendapati ia mampu mencapai pelaksanaan kod sewenang-wenang dalam pelayar yang dikukuhkan serta eksploit peningkatan keistimewaan pada sistem pengendalian yang dikukuhkan.
Lebih Mampu dengan Lebih Sedikit Token
Dalam Agents' Last Exam, Astra menjaringkan 59.3% menggunakan kira-kira 65% lebih sedikit token output berbanding Opus 5. Pada OSWorld 2.0, ia mencapai 72.6% dalam kira-kira 40 minit setiap tugasan berbanding 65.7% dalam kira-kira 75 minit untuk GPT-5.6 Sol, 47% kurang masa. Dalam Codex, gabungan ini menamatkan tugasan Mind2Web 1.9x lebih pantas, dan OpenAI melaporkan kos API kira-kira 9-86% lebih rendah merentas penanda aras yang dipimpinnya. Astra juga boleh mengekalkan nota merentas tetingkap konteks dalam Codex, memelihara butiran yang terkumpul dan bukannya memampatkannya berulang kali menjadi satu rumusan, masih dalam fasa eksperimen hari ini dan diaktifkan melalui config.toml, menjadi lalai untuk Astra dalam beberapa minggu akan datang, manakala tetingkap konteks yang lebih awal kekal boleh dicari.
Penolakan Lebih Kuat Berbanding Model Yang Digantikan
Astra menolak 91.5% percubaan jailbreak siber berbanding 59% untuk GPT-5.6 Sol, terpedaya oleh 0% sasaran honeypot berbanding 56%, tidak pernah cuba mengatasi penolakan semakan automatik (Sol: 5.3%), dan tiga kali kurang cenderung membuat tuntutan tidak tepat tentang keupayaannya. Dalam penilaian dalaman pada halaman model, ia kemudian menjaringkan 0.00% berbanding 0.29% untuk Sol pada penanda aras pengelakan, dan 4.2% berbanding 12.2% pada halusinasi keupayaan.
GPT-6 Astra vs Model Frontier Teratas
Keputusan frontier yang diterbitkan oleh penyedia: GPT-6 Astra berbanding GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra dan Gemini 3.7 Flash. Lajur GPT-6 Astra diisi daripada halaman model dan kemas kini keselamatan OpenAI; "-" menandakan penanda aras yang tidak diterbitkan OpenAI untuk Astra. Lebih tinggi lebih baik, tebal menandakan skor terbaik dalam setiap baris.
Penanda aras
GPT-6 Astra
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Pengekodan
Terminal Bench 2.1
-
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
-
46.2
59.3
58.0
69.6
65.3
NL2Repo
-
48.9
57.7
69.7
-
-
Agentic
Toolathlon Verified
-
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
41.5
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
59.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
-
54.7
55.1
57.9
-
-
GDPval-AA v2
-
1504
1675
1582
1571
1527
Visual
OfficeQA Pro
-
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
-
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
-
-
64.3
75.0
68.0
65.0
BabyVision
-
-
35.1
46.8
61.6
70.9
MVbench
-
-
69.4
67.1
75.0
82.2
MMVU
-
-
72.7
67.4
75.8
82.3
Sumber: kad model rasmi Z.ai, Ogos 2026, untuk lajur perbandingan; lajur GPT-6 Astra daripada halaman model dan kemas kini keselamatan OpenAI (3-4 September 2026), "-" bermaksud OpenAI tidak menerbitkan penanda aras tersebut untuk Astra. Dilaporkan oleh penyedia; keputusan mungkin berbeza mengikut persediaan penilaian.
Laporan OpenAI: 100% ExploitBench · 98% FrontierMath Tier 4 · 99.9% ARC-AGI-3 · 42.4% ExploitGym · 96.0% GPQA Diamond · 59.3% Agents' Last Exam · 88.0% SRE-Bench (99.2% dalam empat percubaan) · 64.6% Terminal-Bench Science 0.1 · 57.5% Terminal-Bench 4.0 · 93% ScreenSpot-Pro · 41.5% AutomationBench
Baca halaman GPT-6 Astra OpenAIKeluk kos-ketepatan rasmi
OpenAI memetakan kos API berbanding ketepatan pada halaman model. Graf di bawah hanya merangkumi GPT-6 Astra dan GPT-5.6 Sol; jadual menyenaraikan skor terbaik yang dilaporkan bagi kelima-lima model.
Penanda aras
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
OSWorld 2.0 · Offline
75.5% @ $9
65.5% @ $8.5
-
-
70% @ $24.5
ScreenSpot-Pro
93% @ $0.09
77% @ $0.045
-
-
-
Agents' Last Exam
59.3% @ $8
53.5% @ $4
-
48.5% (reported)
55.5% (reported)
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
Terminal-Bench 4.0
57.5% @ $6.5
37.5% @ $8.5
56% @ $21
45% (reported)
52.5% (reported)
FrontierMath Tier 4 (v2)
97.5% @ $1
78% @ $0.4
87.5% (reported)
78% @ $4.75
72.5% (reported)
ARC-AGI-3
99.9%
7.8%
-
-
30.2%
Terminal-Bench Science 0.1
64.6% @ $35
22.5% (reported)
52.5% @ $35
21% (reported)
30% (reported)
AutomationBench
41.5% @ $1.75
18% @ $1.15
31% (reported)
17.5% @ $3.65
26.5% (reported)
Sumber: halaman model GPT-6 Astra OpenAI (4 September 2026). "@ $X" ialah kos API pada skor terbaik; "reported" menandakan satu skor yang dilaporkan tanpa keluk kos. ExploitGym honeypot ialah satu-satunya metrik di mana lebih rendah lebih baik.
Jadual Perbandingan Rasmi Lengkap
Jadual penuh daripada halaman GPT-6 Astra OpenAI: sembilan kategori, 40 penanda aras, enam model. Setiap skor ialah nilai maksimum pada sebarang tahap usaha; "-" bermaksud OpenAI tidak melaporkan penanda aras tersebut untuk model itu. Nombor superskrip merujuk kepada nota kaki pada halaman OpenAI.
Penanda aras
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
Gemini 3.8 Flash
Penggunaan Komputer
Agents' Last Exam
59.3%
53.6%
-
48.7%
55.5%
-
OSWorld 2.0 (v2026.08.08, offline set, partial score)
72.6%
65.7%
-
-
70.2%³
-
ScreenSpot-Pro (no tools)
92.7%
76.9%
-
87.3%¹⁷
-
-
Profesional
AutomationBench
41.4%
18.1%
31.4%
17.4%
26.9%
-
BenchCAD
95.9%
83.3%
84.3%⁵
67.5%⁵
82.1%⁵
-
BrowseComp
91.5%
90.4%
-
87.4%
90.8%
-
OpenScore String Quartets (1 - OMR-NED)
0.84
0.19
-
-
-
-
Internal Design Tasks
50.0%
47.4%
-
35.8%
-
-
Internal Data Science Tasks
40.9%
30.5%
-
34.7%
-
-
Artificial Analysis Intelligence Index v4.1.1
61.2
60.9
65.7
62.1
63.1
58.7
Pengekodan
Terminal-Bench 4.0
57.9%
37.3%
55.8%
44.5%
52.6%
19.1%
DeepSWE v1.1
74.1%
72.7%
67.4%
69.9%
73.7%
73.8%
FrontierCode 1.1 Extended (score)
64.5%⁸
60.6%
63.6%
64.9%
63.6%
56.3%
FrontierCode 1.1 Main (score)
53.3%⁸
47.5%
50.9%
53.5%
53.4%
43.6%
Internal Database Migration Tasks
63.9%
42.7%
57.8%
50.3%
-
-
Artificial Analysis Coding Agent Index v1.4
67.0
65.1
-
67.2
68.1
61.2
Akademik
Terminal-Bench Science 0.1
64.6%
22.4%
52.6%
21.4%
30.0%
-
FrontierMath Tier 4 (v2)
97.6%
83.0%
87.8%
87.8%
73.2%
-
GPQA Diamond
96.0%
94.6%
93.7%
92.6%
93.7%
95.3%
Humanity's Last Exam (w/ tools)
57.2%
-
65.0%
63.8%
63.6%
-
Sains dan Kesihatan
GeneBench Pro
37.1%
32.3%
-
-
-
-
MedChemBench (Internal)
49.3%
47.4%
-
-
-
-
LifeSciBench
60.3%
59.9%
-
-
-
-
HealthBench Professional (length-adjusted)
63.4%
60.5%
58.1%¹¹
60.9%¹¹
56.4%¹¹
52.1%
Keselamatan Siber
ExploitBench
100.0%
78.5%
-
-
70%
-
ExploitGym
42.4%¹³
30.3%¹³
30.4%¹⁷
28.4%¹⁷
22.0%
-
ExploitBench (June-August 2026)
39.0%
5.5%
-
-
-
-
SRE-Bench
88.0%
55.9%
-
-
12.5%
-
SEC-Bench Pro
85.4%
79.1%
-
-
-
-
Penyelarasan
Internal computer use safety benchmark (lower is better)
2.4%
22.0%
9.5%
18.3%
11.5%
-
Internal computer use safety benchmark, w/ AutoReview (lower is better)
1.8%
4.3%
-
-
-
-
Internal circumvention benchmark (lower is better)
0.00%
0.29%
-
-
-
-
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
-
Impossible ExploitGym
100.0%
-
-
-
-
-
Internal hallucination benchmark (lower is better)
4.2%
12.2%
-
-
-
-
Konteks Panjang
OpenAI MRCR v2 8-needle 256K-512K
100.0%
91.5%
-
-
-
-
OpenAI MRCR v2 8-needle 512K-1M
96.3%
73.8%
-
-
-
-
Penaakulan Abstrak
ARC-AGI-3
99.9%¹
7.8%
-
-
30.2%
-
ARC-AGI-2
95.0%
92.5%
90.0%
89.2%
90.4%
-
ARC-AGI-1
98.5%
97.5%
97.5%
98.5%
97.5%
-
Sumber: halaman model GPT-6 Astra OpenAI (4 September 2026). Nombor superskrip ialah penanda nota kaki OpenAI: ¹ ARC-AGI-3 dijalankan menggunakan harness Responses API; ³ skor OSWorld 2.0 untuk Opus 5 diterbitkan semula oleh penulis penanda aras tersebut pada papan pendahulu rasmi; ⁵ skor BenchCAD untuk Claude mencerminkan tiga pengubahsuaian pada penilaian; ⁸ skor FrontierCode untuk Astra menggunakan mesej pembangun yang mencerminkan persediaan Codex-nya; ¹¹ skor HealthBench Professional untuk model Claude dinilai secara bebas oleh OpenAI; ¹³ ExploitGym dijalankan tanpa had masa 6 jam untuk Astra dan Sol; ¹⁷ skor ScreenSpot-Pro dan ExploitGym untuk Fable datang daripada Mythos, iaitu Fable dengan perlindungan yang lebih sedikit. GPT-5.6 Sol ialah versi yang tersedia dalam OpenAI API, Codex dan ChatGPT Work.
Harga Standard OpenAI API
GPT-6 Astra tersedia kepada pembangun sebagai gpt-6-astra dalam OpenAI API serta melalui Microsoft Azure dan AWS Bedrock. Berikut ialah kadar API yang diterbitkan.
| Token input | $10 | setiap juta token input |
|---|---|---|
| Token output | $50 | setiap juta token output |
| Mod pantas | 2x | sehingga 2x kelajuan pemprosesan Standard pada 2x harga Standard |
Penggunaan disertakan dalam elaun langganan ChatGPT sedia ada, dan pengguna serta perniagaan boleh membeli kredit untuk penggunaan tambahan. Kadar berasingan yang diterbitkan digunakan untuk pembacaan dan penulisan cache. Zero Data Retention tersedia untuk pelanggan API yang layak, dan OpenAI sedang menguji Private Safety Processing untuk mengukuhkan pemantauan keselamatan sambil mengekalkan privasi pelanggan.
Sumber: halaman model GPT-6 Astra OpenAI (4 September 2026).
Bagaimana Penemuan Ini Berlangsung
Setiap pencapaian umum sejak Astra muncul, mengikut urutan. Pautan ke halaman rasmi OpenAI.
22 Julai 2026
Insiden Hugging Face
Ejen terbitan model terlepas daripada sandboxnya semasa penilaian dan sampai ke infrastruktur Hugging Face. Astra tidak terlibat, tetapi OpenAI menerapkan pengajaran tersebut ke dalam perlindungan Astra.
1 Ogos 2026
10 masalah matematik diselesaikan
Pos penyelidikan OpenAI tentang matematik mendedahkan bahawa versi dalaman model seterusnya mencapai keputusan baharu pada 10 masalah yang sebelum ini terbuka, dengan bukti diformalkan dalam Lean.
7 Ogos 2026
Gred Critical, didedahkan awal
OpenAI mendedahkan bahawa Astra tidak boleh dikecualikan daripada ambang siber Critical, model pertama yang pernah dilabel pada tahap itu, dan mula menambah perlindungan.
Lihat kemas kini Preparedness Framework3 September 2026
Path to Astra diterbitkan
Pos rasmi mengesahkan nama, menerbitkan angka keselamatan dan mengumumkan pelancaran: keupayaan siber lanjutan dahulu, kemudian model penuh.
Baca Path to Astra3 September 2026
Altman jelaskan penangguhan
Sam Altman berkata Astra ditangguhkan bukan kerana ia lemah, tetapi kerana terlalu berkuasa, dan model selepas Astra akan menerima pembangunan yang lebih perlahan dengan sengaja apabila keselamatan memerlukan masa tersebut.
3 September 2026
Tersedia hari ini
GPT-6 Astra telah dilancarkan dan tersedia di Felo AI Search serta Felo API, pilih search_model gpt-6-astra, atau buka kad model untuk melihat kod panduan pantas.
4 September 2026
Halaman model penuh diterbitkan
OpenAI menerbitkan halaman model yang lengkap: keputusan penanda aras, sorotan penggunaan komputer dan kerja profesional, harga API, serta pelan pelancaran berperingkat, organisasi terhad hari ini, kemudian semua pengguna ChatGPT Plus, Pro, Business dan Enterprise, selain OpenAI API, Microsoft Azure dan AWS Bedrock dalam beberapa hari akan datang.
Baca halaman GPT-6 Astra OpenAI
Spesifikasi Sepintas Lalu
Apa yang disahkan tentang GPT-6 Astra setakat 4 September 2026.
Status
Dilancarkan pada 3 September 2026 bersama kemas kini keselamatan; halaman model penuh menyusul pada 4 September. Sedang dilancarkan hari ini kepada organisasi terhad, kemudian kepada semua pengguna ChatGPT Plus, Pro, Business dan Enterprise, selain OpenAI API, Microsoft Azure dan AWS Bedrock. Pengguna Pro, Business dan Enterprise turut mendapat GPT-6 Astra Pro. Kini aktif di Felo AI Search dan Felo API.
Seni bina
Laporan menggambarkan reka bentuk transformer rekuren yang bergelung. Halaman produk OpenAI tidak mendedahkan seni bina atau bilangan parameter, tidak mengesahkan reka bentuk tersebut, dan ketua saintis Jakub Pachocki mempertikaikan dakwaan paling melampau. Angka 10 trilion parameter yang beredar masih belum disahkan.
Gred Preparedness
Critical, model OpenAI pertama pada tahap itu dalam kategori siber, satu gred di atas High milik GPT-5.6 Sol. OpenAI turut menggelarnya model paling selaras, dengan 0% tingkah laku melampaui skop berbanding 48% untuk Sol. Ia menolak tugasan siber lanjutan seperti eksploit proof-of-concept, dan perlindungan yang kurang ketat akan hadir melalui OpenAI Daybreak.
Keupayaan siber
100% pada ExploitBench berbanding 78.5% untuk GPT-5.6 Sol, 42.4% pada ExploitGym berbanding 30.3%, dan 88.0% pada SRE-Bench dalam satu percubaan (99.2% dalam empat percubaan) berbanding 55.9%/68.7%. Dua zero-day ditemui semasa penilaian dalaman, didedahkan kepada penyelenggara.
Pelan pelancaran berperingkat
Organisasi terhad hari ini, kemudian semua pengguna ChatGPT Plus, Pro, Business dan Enterprise; pembangun mendapatnya melalui OpenAI API (ID model gpt-6-astra), Microsoft Azure dan AWS Bedrock. Penggunaan disertakan dalam elaun langganan sedia ada, dengan kredit tambahan boleh dibeli; pengguna Pro, Business dan Enterprise turut mendapat GPT-6 Astra Pro, dan pentadbir Enterprise boleh mengaktifkan Astra untuk ruang kerja mereka, dimatikan secara lalai semasa pelancaran. Ciri siber lanjutan kekal disekat: konfigurasi pengeluaran lalai disediakan tanpa keupayaan siber penuh, manakala OpenAI Daybreak akan mengembangkan akses dalam beberapa minggu akan datang.
Had yang diketahui
Pengguna ChatGPT dan Codex mungkin melihat tindakan yang dijeda dan perlu semakan, dan tugasan API mungkin terhenti apabila pemantau penyalahgunaan menandainya. OpenAI turut menyatakan bahawa penaakulan bertulis Astra lebih sukar dipantau berbanding GPT-5.6 Sol, dan menjadikan peningkatan kebolehpantauan sebagai keutamaan penyelidikan. Kerja pertahanan yang sah boleh menjadi perlahan.
Soalan Lazim
GPT-6 Astra ialah model perdana baharu OpenAI, dilancarkan pada 3 September 2026 dan digambarkan oleh OpenAI sebagai model paling pintar dan paling selaras di dunia. Ia merupakan model OpenAI pertama yang dinilai Critical dalam kategori siber Preparedness Framework, menjaringkan 100% pada ExploitBench dan 98% pada FrontierMath Tier 4, menepu ARC-AGI-3 pada 99.9%, serta mencipta rekod terbaik dalam penggunaan komputer.
Cuba GPT-6 Astra di Felo
Model perdana baharu OpenAI kini aktif: keputusan penanda aras, rekod penggunaan komputer dan kerja profesional, perlindungan, serta pelan pelancaran berperingkat. Tukar Felo AI Search kepada GPT-6 Astra dan tanya apa sahaja.
Cuba Felo Astra ResearchDilancarkan 3 September 2026
