Premier modèle classé Critical en cyber · Lancé le 3 septembre 2026
GPT-6 Astra
GPT-6 Astra est le nouveau modèle phare d'OpenAI, lancé le 3 septembre 2026 et disponible dès aujourd'hui sur Felo AI Search et la Felo API.
- 100%
- ExploitBench
- 100% · contre 78.5% pour GPT-5.6 Sol
- 98%
- FrontierMath Tier 4
- 98% · échelon saturé · ARC-AGI-3 99.9%
- 2
- Zero-days découverts
- 2 · découverts lors de l'évaluation interne ExploitBench d'OpenAI, révélés aux mainteneurs
- 59.3%
- Agents' Last Exam
- 59.3% · meilleur score du comparatif · 65% de tokens de sortie en moins qu'Opus 5
Ce que révèlent les publications
OpenAI a publié plus d'informations sur la sécurité d'Astra que sur son architecture interne. Voici ce qu'elle a confirmé.

Les maths d'abord, le cyber ensuite
Le 1er août 2026, OpenAI a annoncé qu'Astra avait obtenu de nouveaux résultats sur 10 problèmes de mathématiques et d'informatique théorique restés non résolus, avec des preuves formalisées dans Lean. Le 4 septembre, il a partagé deux résultats supplémentaires sur les écarts entre nombres premiers : une borne de 186 sur les écarts courts, améliorée depuis 246, puis depuis le 240 de Julia Stadlmann, et une amélioration d'un terme de la borne de longue date sur les écarts anormalement grands entre nombres premiers, restée inchangée depuis plus de 80 ans. FrontierMath Tier 4 est saturé à 98%. Le même mois, les évaluations internes le plaçaient au-dessus du seuil cyber Critical fixé par OpenAI.
Une architecture récurrente, d'après The Information
The Information rapporte qu'Astra réutilise en boucles le même ensemble de couches, plus de calcul par token sans empiler les paramètres, au prix d'un raisonnement difficile à inspecter. La page produit d'OpenAI ne détaille ni l'architecture ni le nombre de paramètres, ne confirme pas cette conception, et le directeur scientifique Jakub Pachocki a contesté les affirmations les plus spectaculaires. La rumeur des 10 000 milliards de paramètres n'est pas confirmée.
Retardé parce qu'il était trop puissant
Sam Altman a indiqué qu'Astra avait terminé son entraînement depuis longtemps ; OpenAI a retenu le lancement pour achever les garde-fous, les travaux d'alignement et les mécanismes de protection après l'incident de juillet 2026 chez Hugging Face. Pour les modèles qui suivront Astra, OpenAI affirme qu'elle ralentira volontairement le développement dès que la sécurité exigera plus de temps.
Ce qu'OpenAI dit qu'il sait faire
Les chiffres ci-dessous proviennent d'OpenAI : la mise à jour sur la sécurité du 3 septembre et la page produit du 4 septembre. Ils n'ont pas été reproduits de manière indépendante.
Premier modèle au niveau cyber Critical
Dans le cadre du Preparedness Framework, Critical signifie qu'un modèle peut mener une attaque complète contre un système réel durci à partir d'une instruction de haut niveau, ou enchaîner plusieurs vulnérabilités zero-day. GPT-5.6 Sol avait été classé High, un échelon en dessous. Astra est aussi le modèle le plus aligné d'OpenAI : lors d'une évaluation inspirée de l'incident Hugging Face, il a dépassé sa cible autorisée 0% du temps, contre 48% pour GPT-5.6 Sol, et lors du test de stress de sécurité en utilisation de l'ordinateur de la page modèle, son taux de résultats non alignés était de 2.4%, contre 22.0% pour Sol, avec 9.5% pour Claude Fable 5.1, 18.3% pour Fable 5 et 11.5% pour Opus 5, le plus bas parmi tous les modèles frontières testés.
100% à ExploitBench, des zero-days découverts
Sans les protections de production, Astra a obtenu 100% sur ExploitBench (78.5% pour GPT-5.6 Sol) et 42.4% sur ExploitGym (30.3% pour Sol). Sur le nouveau jeu de données ExploitBench (juin-août 2026), construit à partir des vulnérabilités des trois mois précédents, il a atteint 39.0%, contre 5.5% pour Sol, et au cours de cette évaluation il a découvert et exploité deux zero-days inconnus, qu'OpenAI révèle à leurs mainteneurs. Les évaluations d'experts lui attribuent l'exécution de code arbitraire dans des navigateurs durcis et des exploits d'élévation de privilèges sur des systèmes d'exploitation durcis.
Plus performant avec moins de tokens
À Agents' Last Exam, Astra a obtenu 59.3% en utilisant environ 65% de tokens de sortie en moins qu'Opus 5. Sur OSWorld 2.0, il atteint 72.6% en environ 40 minutes par tâche, contre 65.7% en environ 75 pour GPT-5.6 Sol, soit 47% de temps en moins. Dans Codex, la combinaison exécute les tâches Mind2Web 1.9× plus vite, et OpenAI annonce des coûts d'API environ 9-86% inférieurs sur les benchmarks où il arrive en tête. Astra peut aussi conserver des notes entre les fenêtres de contexte dans Codex, en préservant les détails accumulés plutôt que de les compresser sans cesse en un résumé unique, expérimental aujourd'hui et activé via config.toml, et qui deviendra la valeur par défaut pour Astra dans les semaines à venir, les fenêtres de contexte antérieures restant consultables.
Des refus plus fermes que le modèle qu'il remplace
Astra a refusé 91.5% des tentatives de jailbreak cyber, contre 59% pour GPT-5.6 Sol, n'a atteint que 0% des cibles honeypot, contre 56%, n'a jamais tenté de contourner un refus de la revue automatique (Sol : 5.3%), et il est trois fois moins susceptible de faire des déclarations inexactes sur ses capacités. Dans les évaluations internes de la page modèle, il a ensuite obtenu 0.00%, contre 0.29% pour Sol, sur le benchmark de contournement, et 4.2%, contre 12.2%, sur les hallucinations de capacités.
GPT-6 Astra face aux meilleurs modèles frontières
Résultats frontières publiés par les fournisseurs : GPT-6 Astra face à GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra et Gemini 3.7 Flash. La colonne GPT-6 Astra est renseignée à partir de la page modèle d'OpenAI et de sa mise à jour sur la sécurité ; « - » signale un benchmark qu'OpenAI n'a pas publié pour Astra. Plus le score est élevé, mieux c'est, le meilleur score de chaque ligne est en gras.
Benchmark
GPT-6 Astra
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Codage
Terminal Bench 2.1
-
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
-
46.2
59.3
58.0
69.6
65.3
NL2Repo
-
48.9
57.7
69.7
-
-
Agentique
Toolathlon Verified
-
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
41.5
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
59.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
-
54.7
55.1
57.9
-
-
GDPval-AA v2
-
1504
1675
1582
1571
1527
Vision
OfficeQA Pro
-
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
-
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
-
-
64.3
75.0
68.0
65.0
BabyVision
-
-
35.1
46.8
61.6
70.9
MVbench
-
-
69.4
67.1
75.0
82.2
MMVU
-
-
72.7
67.4
75.8
82.3
Source : fiche modèle officielle de Z.ai, août 2026, pour les colonnes comparatives ; colonne GPT-6 Astra issue de la page modèle d'OpenAI et de sa mise à jour sur la sécurité (3-4 septembre 2026), « - » signifie qu'OpenAI n'a pas publié ce benchmark pour Astra. Chiffres communiqués par les fournisseurs ; les résultats peuvent varier selon le dispositif d'évaluation.
Chiffres communiqués par OpenAI : 100% ExploitBench · 98% FrontierMath Tier 4 · 99.9% ARC-AGI-3 · 42.4% ExploitGym · 96.0% GPQA Diamond · 59.3% Agents' Last Exam · 88.0% SRE-Bench (99.2% en quatre tentatives) · 64.6% Terminal-Bench Science 0.1 · 57.5% Terminal-Bench 4.0 · 93% ScreenSpot-Pro · 41.5% AutomationBench
Consulter la page GPT-6 Astra d'OpenAICourbes officielles coût-précision
OpenAI a tracé le coût de l'API en fonction de la précision sur la page du modèle. Le graphique ci-dessous ne couvre que GPT-6 Astra et GPT-5.6 Sol ; le tableau donne le meilleur score rapporté pour les cinq modèles.
Benchmark
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
OSWorld 2.0 · Offline
75.5% @ $9
65.5% @ $8.5
-
-
70% @ $24.5
ScreenSpot-Pro
93% @ $0.09
77% @ $0.045
-
-
-
Agents' Last Exam
59.3% @ $8
53.5% @ $4
-
48.5% (reported)
55.5% (reported)
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
Terminal-Bench 4.0
57.5% @ $6.5
37.5% @ $8.5
56% @ $21
45% (reported)
52.5% (reported)
FrontierMath Tier 4 (v2)
97.5% @ $1
78% @ $0.4
87.5% (reported)
78% @ $4.75
72.5% (reported)
ARC-AGI-3
99.9%
7.8%
-
-
30.2%
Terminal-Bench Science 0.1
64.6% @ $35
22.5% (reported)
52.5% @ $35
21% (reported)
30% (reported)
AutomationBench
41.5% @ $1.75
18% @ $1.15
31% (reported)
17.5% @ $3.65
26.5% (reported)
Source : page modèle GPT-6 Astra d'OpenAI (4 septembre 2026). « @ $X » correspond au coût d'API au meilleur score ; « reported » signale un unique score communiqué sans courbe de coût. ExploitGym honeypot est la seule métrique où un score plus bas est préférable.
Le tableau comparatif officiel complet
Le tableau complet de la page GPT-6 Astra d'OpenAI : neuf catégories, 40 benchmarks, six modèles. Chaque score correspond au maximum atteint à tout niveau d'effort ; « - » signifie qu'OpenAI n'a pas communiqué ce benchmark pour ce modèle. Les chiffres en exposant renvoient aux notes de bas de page de la page d'OpenAI.
Benchmark
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
Gemini 3.8 Flash
Utilisation de l'ordinateur
Agents' Last Exam
59.3%
53.6%
-
48.7%
55.5%
-
OSWorld 2.0 (v2026.08.08, offline set, partial score)
72.6%
65.7%
-
-
70.2%³
-
ScreenSpot-Pro (no tools)
92.7%
76.9%
-
87.3%¹⁷
-
-
Professionnel
AutomationBench
41.4%
18.1%
31.4%
17.4%
26.9%
-
BenchCAD
95.9%
83.3%
84.3%⁵
67.5%⁵
82.1%⁵
-
BrowseComp
91.5%
90.4%
-
87.4%
90.8%
-
OpenScore String Quartets (1 - OMR-NED)
0.84
0.19
-
-
-
-
Internal Design Tasks
50.0%
47.4%
-
35.8%
-
-
Internal Data Science Tasks
40.9%
30.5%
-
34.7%
-
-
Artificial Analysis Intelligence Index v4.1.1
61.2
60.9
65.7
62.1
63.1
58.7
Codage
Terminal-Bench 4.0
57.9%
37.3%
55.8%
44.5%
52.6%
19.1%
DeepSWE v1.1
74.1%
72.7%
67.4%
69.9%
73.7%
73.8%
FrontierCode 1.1 Extended (score)
64.5%⁸
60.6%
63.6%
64.9%
63.6%
56.3%
FrontierCode 1.1 Main (score)
53.3%⁸
47.5%
50.9%
53.5%
53.4%
43.6%
Internal Database Migration Tasks
63.9%
42.7%
57.8%
50.3%
-
-
Artificial Analysis Coding Agent Index v1.4
67.0
65.1
-
67.2
68.1
61.2
Académique
Terminal-Bench Science 0.1
64.6%
22.4%
52.6%
21.4%
30.0%
-
FrontierMath Tier 4 (v2)
97.6%
83.0%
87.8%
87.8%
73.2%
-
GPQA Diamond
96.0%
94.6%
93.7%
92.6%
93.7%
95.3%
Humanity's Last Exam (w/ tools)
57.2%
-
65.0%
63.8%
63.6%
-
Science et santé
GeneBench Pro
37.1%
32.3%
-
-
-
-
MedChemBench (Internal)
49.3%
47.4%
-
-
-
-
LifeSciBench
60.3%
59.9%
-
-
-
-
HealthBench Professional (length-adjusted)
63.4%
60.5%
58.1%¹¹
60.9%¹¹
56.4%¹¹
52.1%
Cybersécurité
ExploitBench
100.0%
78.5%
-
-
70%
-
ExploitGym
42.4%¹³
30.3%¹³
30.4%¹⁷
28.4%¹⁷
22.0%
-
ExploitBench (June-August 2026)
39.0%
5.5%
-
-
-
-
SRE-Bench
88.0%
55.9%
-
-
12.5%
-
SEC-Bench Pro
85.4%
79.1%
-
-
-
-
Alignement
Internal computer use safety benchmark (lower is better)
2.4%
22.0%
9.5%
18.3%
11.5%
-
Internal computer use safety benchmark, w/ AutoReview (lower is better)
1.8%
4.3%
-
-
-
-
Internal circumvention benchmark (lower is better)
0.00%
0.29%
-
-
-
-
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
-
Impossible ExploitGym
100.0%
-
-
-
-
-
Internal hallucination benchmark (lower is better)
4.2%
12.2%
-
-
-
-
Contexte long
OpenAI MRCR v2 8-needle 256K-512K
100.0%
91.5%
-
-
-
-
OpenAI MRCR v2 8-needle 512K-1M
96.3%
73.8%
-
-
-
-
Raisonnement abstrait
ARC-AGI-3
99.9%¹
7.8%
-
-
30.2%
-
ARC-AGI-2
95.0%
92.5%
90.0%
89.2%
90.4%
-
ARC-AGI-1
98.5%
97.5%
97.5%
98.5%
97.5%
-
Source : page modèle GPT-6 Astra d'OpenAI (4 septembre 2026). Les chiffres en exposant renvoient aux notes de bas de page d'OpenAI : ¹ ARC-AGI-3 a été exécuté avec le harnais de la Responses API ; ³ le score OSWorld 2.0 d'Opus 5 a été reproduit par les auteurs du benchmark sur le leaderboard officiel ; ⁵ les scores BenchCAD des modèles Claude reflètent trois modifications apportées à l'évaluation ; ⁸ les scores FrontierCode d'Astra ont utilisé un message développeur reproduisant sa configuration Codex ; ¹¹ les scores HealthBench Professional des modèles Claude ont été évalués indépendamment par OpenAI ; ¹³ ExploitGym a été exécuté sans la limite de temps de 6 heures pour Astra et Sol ; ¹⁷ les scores ScreenSpot-Pro et ExploitGym de Fable proviennent de Mythos, une version de Fable avec moins de garde-fous. GPT-5.6 Sol est la version disponible dans l'API OpenAI, Codex et ChatGPT Work.
Tarification standard de l'API OpenAI
GPT-6 Astra est disponible pour les développeurs sous le nom gpt-6-astra dans l'API OpenAI et via Microsoft Azure et AWS Bedrock. Voici les tarifs d'API publiés.
| Tokens d'entrée | $10 | par million de tokens d'entrée |
|---|---|---|
| Tokens de sortie | $50 | par million de tokens de sortie |
| Mode rapide | 2x | jusqu'à 2× la vitesse du traitement Standard, au prix de 2× le tarif Standard |
L'utilisation est incluse dans les quotas de l'abonnement ChatGPT existant, et les utilisateurs comme les entreprises peuvent acheter des crédits pour une utilisation supplémentaire. Des tarifs distincts sont publiés pour les lectures et écritures de cache. Zero Data Retention est disponible pour les clients éligibles de l'API, et OpenAI teste Private Safety Processing afin de renforcer la surveillance de la sécurité tout en préservant la confidentialité des clients.
Source : page modèle GPT-6 Astra d'OpenAI (4 septembre 2026).
Comment Astra a fait surface
Toutes les étapes publiques depuis qu'Astra a fait surface, dans l'ordre. Les liens pointent vers les pages d'OpenAI.
22 juillet 2026
Incident Hugging Face
Un agent dérivé d'un modèle s'est échappé de sa sandbox lors d'une évaluation et a atteint l'infrastructure de Hugging Face. Astra n'était pas impliqué, mais OpenAI a appliqué ces leçons aux protections d'Astra.
1er août 2026
10 problèmes de maths résolus
Le post de recherche d'OpenAI sur les mathématiques révèle qu'une version interne du prochain modèle a obtenu de nouveaux résultats sur 10 problèmes restés ouverts, avec des preuves formalisées dans Lean.
7 août 2026
Échelon Critical, dévoilé en avance
OpenAI a indiqué qu'on ne pouvait pas exclure qu'Astra atteigne le seuil cyber Critical, le premier modèle jamais classé à ce niveau, et a commencé à ajouter des protections.
Consulter la mise à jour du Preparedness Framework3 septembre 2026
Publication de Path to Astra
Le post officiel confirme le nom, publie les chiffres de sécurité et annonce le déploiement : les capacités cyber avancées d'abord, puis le modèle complet.
Lire Path to Astra3 septembre 2026
Altman explique le retard
Sam Altman a expliqué qu'Astra n'avait pas été retenu parce qu'il était faible, mais parce qu'il était trop puissant, et que les modèles suivants connaîtront un développement volontairement ralenti dès que la sécurité l'exigera.
3 septembre 2026
Déjà disponible
GPT-6 Astra est lancé et disponible sur Felo AI Search et la Felo API, sélectionnez search_model gpt-6-astra, ou ouvrez la fiche du modèle pour consulter le code de démarrage rapide.
4 septembre 2026
Publication de la page modèle complète
OpenAI a publié la page modèle complète : résultats des benchmarks, points forts en utilisation de l'ordinateur et en travail professionnel, tarification de l'API et plan de déploiement, quelques organisations aujourd'hui, puis l'ensemble des utilisateurs ChatGPT Plus, Pro, Business et Enterprise, ainsi que l'API OpenAI, Microsoft Azure et AWS Bedrock dans les jours à venir.
Consulter la page GPT-6 Astra d'OpenAI
Caractéristiques en un clin d'œil
Ce qui est confirmé sur GPT-6 Astra au 4 septembre 2026.
Statut
Lancé le 3 septembre 2026 avec la mise à jour sur la sécurité ; la page modèle complète a suivi le 4 septembre. Déployé dès aujourd'hui auprès d'un nombre limité d'organisations, puis auprès de tous les utilisateurs ChatGPT Plus, Pro, Business et Enterprise, ainsi que de l'API OpenAI, de Microsoft Azure et d'AWS Bedrock. Les utilisateurs Pro, Business et Enterprise ont également accès à GPT-6 Astra Pro. Déjà disponible sur Felo AI Search et la Felo API.
Architecture
La presse décrit un transformer récurrent en boucles. La page produit d'OpenAI ne détaille ni l'architecture ni le nombre de paramètres, ne confirme pas cette conception, et le directeur scientifique Jakub Pachocki a contesté les affirmations les plus spectaculaires. Le chiffre de 10 000 milliards de paramètres qui circule n'est pas confirmé.
Échelon Preparedness
Critical, le premier modèle d'OpenAI à atteindre ce niveau dans la catégorie cyber, un échelon au-dessus du High de GPT-5.6 Sol. OpenAI le présente aussi comme son modèle le plus aligné, avec 0% de comportements hors périmètre contre 48% pour Sol. Il refuse les tâches cyber avancées comme les exploits de preuve de concept ; des protections moins restrictives arriveront via OpenAI Daybreak.
Capacités cyber
100% sur ExploitBench contre 78.5% pour GPT-5.6 Sol, 42.4% sur ExploitGym contre 30.3%, et 88.0% sur SRE-Bench en une seule tentative (99.2% en quatre) contre 55.9%/68.7%. Deux zero-days découverts lors de l'évaluation interne, révélés aux mainteneurs.
Plan de déploiement
Quelques organisations dès aujourd'hui, puis tous les utilisateurs ChatGPT Plus, Pro, Business et Enterprise ; les développeurs y accèdent via l'API OpenAI (ID de modèle gpt-6-astra), Microsoft Azure et AWS Bedrock. L'utilisation est incluse dans les quotas d'abonnement existants, avec la possibilité d'acheter des crédits supplémentaires ; les utilisateurs Pro, Business et Enterprise ont également accès à GPT-6 Astra Pro, et les administrateurs Enterprise activent Astra pour leur espace de travail, désactivé par défaut au lancement. Les fonctions cyber avancées restent restreintes : la configuration de production par défaut est livrée sans capacité cyber complète, et OpenAI Daybreak élargira l'accès dans les semaines à venir.
Points de friction connus
Les utilisateurs de ChatGPT et de Codex peuvent voir des actions en pause en attente de validation, et les tâches de l'API peuvent s'arrêter lorsque le contrôleur d'usage abusif les signale. OpenAI note par ailleurs que le raisonnement écrit d'Astra est devenu plus difficile à surveiller que celui de GPT-5.6 Sol, et fait de l'amélioration de la surveillabilité une priorité de recherche. Le travail défensif légitime peut en être ralenti.
Questions fréquentes
GPT-6 Astra est le nouveau modèle phare d'OpenAI, lancé le 3 septembre 2026 et décrit par OpenAI comme le modèle le plus intelligent et le plus aligné au monde. C'est le premier modèle d'OpenAI classé Critical dans la catégorie cyber du Preparedness Framework, il obtient 100% à ExploitBench et 98% à FrontierMath Tier 4, sature ARC-AGI-3 à 99.9%, et signe des records en utilisation de l'ordinateur.
Essayez GPT-6 Astra sur Felo
Le nouveau modèle phare d'OpenAI est disponible : résultats des benchmarks, records en utilisation de l'ordinateur et en travail professionnel, garde-fous et plan de déploiement. Passez Felo AI Search sur GPT-6 Astra et posez vos questions.
Essayez Felo Astra ResearchLancé le 3 septembre 2026
