サイバーカテゴリ初のCritical · 2026年9月3日公開

GPT-6 Astra

GPT-6 Astraは、2026年9月3日に公開されたOpenAIの新たなフラッグシップモデルで、本日からFelo AI SearchとFelo APIで利用できます。

100%
ExploitBench
100% · GPT-5.6 Solは78.5%
98%
FrontierMath Tier 4
98% · ティアの上限に到達 · ARC-AGI-3 99.9%
2
発見されたゼロデイ
2件 · OpenAI内部のExploitBench評価で発見、維持者へ開示
59.3%
Agents' Last Exam
59.3% · 比較対象の中で最高 · Opus 5より出力トークンが65%少ない

開示から見えてくること

OpenAIはAstraの内部構造よりも安全性について多くを公開しています。同社が確認した内容は以下の通りです。

同一の層ブロック4つを横一列に並べ、フィードバックループで結んだブループリント風の図
イメージ図。The Information が報じた再帰的設計で、OpenAI は確認していません。
01

まず数学、そしてサイバーへ

2026年8月1日、OpenAIはAstraが数学と理論計算機科学の未解決問題10問で新たな成果を上げ、その証明がLeanで形式化されたと報告しました。9月4日には素数の間隔に関する成果をさらに2件発表しました。短い素数の間隔に対して186という上界を達成したほか 、 246から、さらにJulia Stadlmannの240からの改善です 、 80年以上も変わっていなかった異常に大きい素数の間隔に関する長年の上界の項も改善しました。FrontierMath Tier 4は98%で上限に到達しています。同じ月の内部評価では、OpenAI自身のCriticalサイバー閾値を上回る結果となりました。

02

報道されている再帰的アーキテクチャ

The Informationは、Astraが同じレイヤー群をループで再利用していると報じています。パラメータを積み上げずにトークンあたりの計算量を増やす一方で、検証しにくい推論という代償を伴います。OpenAIは製品ページでアーキテクチャやパラメータ数を公表しておらず、この設計も確認していません。主任科学者のJakub Pachockiは最も誇張された主張に異議を唱えています。10兆パラメータという噂は未確認です。

03

強力すぎたために延期された

Sam Altmanは、Astraのトレーニングはかなり前に完了していたと述べています。OpenAIは2026年7月のHugging Faceインシデントを受けて、ガードレール、アライメント作業、保護機構を仕上げるために公開を保留しました。また、Astra以降のモデルについては、安全性のための時間がより必要になる場合には意図的に開発を遅らせるとしています。

OpenAIが報告する能力

以下の数値は、2026年9月3日の安全性アップデートと9月4日の製品ページでOpenAIが報告したものです。第三者による再現は行われていません。

Criticalサイバーティアに到達した初のモデル

Preparedness Frameworkでは、Criticalとは、モデルが高レベルの指示から堅牢化された実システムへの完全な攻撃を実行できること、または複数のゼロデイ脆弱性を連鎖できることを意味します。GPT-5.6 Solは1つ下のHighと評価されました。AstraはOpenAIでもっともアラインメントされたモデルでもあります。Hugging Faceインシデントを踏まえた評価では、認可された範囲を超えた行動は0%で、GPT-5.6 Solは48%でした。また、モデルページのコンピュータ操作の安全性ストレステストでは、目標から逸脱した成果の割合が2.4%だったのに対し、Solは22.0%でした。Claude Fable 5.1は9.5%、Fable 5は18.3%、Opus 5は11.5%で、テストされたフロンティアモデルの中では最低でした。

ExploitBenchで100%、ゼロデイも発見

本番運用のセーフガードなしの状態で、AstraはExploitBenchで100%(GPT-5.6 Solは78.5%)、ExploitGymで42.4%(Solは30.3%)を記録しました。新たなExploitBenchデータセット(2026年6月~8月)、 それまでの3か月分の脆弱性から構築された 、 では39.0%に達し、Solは5.5%でした。この評価中には、それまで知られていなかったゼロデイ2件を発見・悪用し、OpenAIはそれぞれの維持者に開示しています。専門家による評価では、堅牢化されたブラウザでの任意コード実行や、堅牢化されたOSでの権限昇格エクスプロイトの達成が確認されています。

少ないトークンでより高い能力を

Agents' Last Examでは、AstraはOpus 5より約65%少ない出力トークンで59.3%を記録しました。OSWorld 2.0では、1タスクあたり約40分で72.6%を達成し、GPT-5.6 Solの約75分・65.7%と比べて47%の時間短縮です。Codexでは、この組み合わせでMind2Webのタスクを1.9倍速く完了し、OpenAIは、AstraがリードするベンチマークではAPIコストがおよそ9-86%低くなると報告しています。また、AstraはCodexでコンテキストウィンドウをまたいでメモを保持でき、蓄積された詳細を毎回ひとつの要約に圧縮し直すのではなく保持します。現在は実験的機能で、config.tomlを介して有効化できます。数週間以内にAstraのデフォルトとなる予定で、それ以前のコンテキストウィンドウも引き続き検索可能です。

置き換え先モデルより強い拒否能力

Astraはサイバー分野のジェイルブレイク試行の91.5%を拒否しました(GPT-5.6 Solは59%)。ハニーポットの標的への試行は0%(Solは56%)で、自動レビューによる却下を回避しようとすることもありませんでした(Sol: 5.3%)。また、自身の能力について不正確な主張をする可能性は3分の1に抑えられています。さらに、モデルページの内部評価では、回避ベンチマークで0.00%(Solは0.29%)、能力に関する幻覚では4.2%(Solは12.2%)を記録しました。

GPT-6 Astra vs. 主要なフロンティアモデル

各プロバイダーが公表したフロンティアモデルの結果です。GPT-6 AstraをGLM-5.2、DeepSeek-V4-Vision-Exp、Opus 4.8、GPT-5.6 Terra、Gemini 3.7 Flashと比較しています。GPT-6 Astraの列はOpenAIのモデルページと安全性アップデートに基づいており、"-"はOpenAIがAstraについて公表していないベンチマークであることを示します。数値が高いほど優れており、各行の最高スコアは太字で示しています。

ベンチマーク

GPT-6 Astra

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

コーディング

Terminal Bench 2.1

-

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

-

46.2

59.3

58.0

69.6

65.3

NL2Repo

-

48.9

57.7

69.7

-

-

エージェント

Toolathlon Verified

-

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

41.5

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

59.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

-

54.7

55.1

57.9

-

-

GDPval-AA v2

-

1504

1675

1582

1571

1527

ビジョン

OfficeQA Pro

-

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

-

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

-

-

64.3

75.0

68.0

65.0

BabyVision

-

-

35.1

46.8

61.6

70.9

MVbench

-

-

69.4

67.1

75.0

82.2

MMVU

-

-

72.7

67.4

75.8

82.3

出典:比較列はZ.aiの公式モデルカード(2026年8月)。GPT-6 Astraの列はOpenAIのモデルページと安全性アップデート(2026年9月3~4日)に基づいており、"-"はOpenAIがAstraの当該ベンチマークを公表していないことを意味します。各社の公表値のため、評価環境によって結果が異なる場合があります。

OpenAI報告値:ExploitBench 100% · FrontierMath Tier 4 98% · ARC-AGI-3 99.9% · ExploitGym 42.4% · GPQA Diamond 96.0% · Agents' Last Exam 59.3% · SRE-Bench 88.0%(4回の試行では99.2%)· Terminal-Bench Science 0.1 64.6% · 57.5% Terminal-Bench 4.0 · 93% ScreenSpot-Pro · 41.5% AutomationBench

OpenAIのGPT-6 Astraページを読む

公式のコスト・精度曲線

OpenAI はモデルページで API コストと精度の関係を示しています。下のグラフは GPT-6 Astra と GPT-5.6 Sol の2モデルのみ、表は5モデルすべての報告済み最高スコアをまとめています。

0%25%50%75%100%$0.05$0.5$5$20APIコスト(対数)GPT-6 AstraGPT-5.6 Sol

ベンチマーク

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

OSWorld 2.0 · Offline

75.5% @ $9

65.5% @ $8.5

-

-

70% @ $24.5

ScreenSpot-Pro

93% @ $0.09

77% @ $0.045

-

-

-

Agents' Last Exam

59.3% @ $8

53.5% @ $4

-

48.5% (reported)

55.5% (reported)

ExploitGym honeypot (lower is better)

0.0%

48.2%

-

-

-

Terminal-Bench 4.0

57.5% @ $6.5

37.5% @ $8.5

56% @ $21

45% (reported)

52.5% (reported)

FrontierMath Tier 4 (v2)

97.5% @ $1

78% @ $0.4

87.5% (reported)

78% @ $4.75

72.5% (reported)

ARC-AGI-3

99.9%

7.8%

-

-

30.2%

Terminal-Bench Science 0.1

64.6% @ $35

22.5% (reported)

52.5% @ $35

21% (reported)

30% (reported)

AutomationBench

41.5% @ $1.75

18% @ $1.15

31% (reported)

17.5% @ $3.65

26.5% (reported)

出典:OpenAIのGPT-6 Astraモデルページ(2026年9月4日)。「@ $X」は最高スコアを記録した時点のAPIコストを表し、「reported」はコスト曲線のない単発の報告スコアであることを示します。ExploitGym honeypotは、値が小さいほど優れている唯一の指標です。

完全な公式比較表

OpenAIのGPT-6 Astraページに掲載された完全な表です。9カテゴリ、40のベンチマーク、6つのモデルを収録しています。各スコアは、どの努力量でも見ても最大の値です。"-"はOpenAIがそのモデルについて当該ベンチマークを公表していないことを示します。上付き数字はOpenAIのページの脚注に対応しています。

ベンチマーク

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

コンピュータ操作

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%³

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%¹⁷

-

-

プロフェッショナル

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3%⁵

67.5%⁵

82.1%⁵

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

コーディング

Terminal-Bench 4.0

57.9%

37.3%

55.8%

44.5%

52.6%

19.1%

DeepSWE v1.1

74.1%

72.7%

67.4%

69.9%

73.7%

73.8%

FrontierCode 1.1 Extended (score)

64.5%⁸

60.6%

63.6%

64.9%

63.6%

56.3%

FrontierCode 1.1 Main (score)

53.3%⁸

47.5%

50.9%

53.5%

53.4%

43.6%

Internal Database Migration Tasks

63.9%

42.7%

57.8%

50.3%

-

-

Artificial Analysis Coding Agent Index v1.4

67.0

65.1

-

67.2

68.1

61.2

アカデミック

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

87.8%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

科学と健康

GeneBench Pro

37.1%

32.3%

-

-

-

-

MedChemBench (Internal)

49.3%

47.4%

-

-

-

-

LifeSciBench

60.3%

59.9%

-

-

-

-

HealthBench Professional (length-adjusted)

63.4%

60.5%

58.1%¹¹

60.9%¹¹

56.4%¹¹

52.1%

サイバーセキュリティ

ExploitBench

100.0%

78.5%

-

-

70%

-

ExploitGym

42.4%¹³

30.3%¹³

30.4%¹⁷

28.4%¹⁷

22.0%

-

ExploitBench (June-August 2026)

39.0%

5.5%

-

-

-

-

SRE-Bench

88.0%

55.9%

-

-

12.5%

-

SEC-Bench Pro

85.4%

79.1%

-

-

-

-

アラインメント

Internal computer use safety benchmark (lower is better)

2.4%

22.0%

9.5%

18.3%

11.5%

-

Internal computer use safety benchmark, w/ AutoReview (lower is better)

1.8%

4.3%

-

-

-

-

Internal circumvention benchmark (lower is better)

0.00%

0.29%

-

-

-

-

ExploitGym honeypot (lower is better)

0.0%

48.2%

-

-

-

-

Impossible ExploitGym

100.0%

-

-

-

-

-

Internal hallucination benchmark (lower is better)

4.2%

12.2%

-

-

-

-

ロングコンテキスト

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

抽象的推論

ARC-AGI-3

99.9%¹

7.8%

-

-

30.2%

-

ARC-AGI-2

95.0%

92.5%

90.0%

89.2%

90.4%

-

ARC-AGI-1

98.5%

97.5%

97.5%

98.5%

97.5%

-

出典:OpenAIのGPT-6 Astraモデルページ(2026年9月4日)。上付き数字はOpenAIのページの脚注番号を示します。¹ ARC-AGI-3はResponses APIハーネスで実行されました。³ Opus 5のOSWorld 2.0スコアは、ベンチマークの作成者らが公式リーダーボードで再現したものです。⁵ ClaudeのBenchCADスコアは、評価に3つの変更を加えたものです。⁸ AstraのFrontierCodeスコアは、Codexの設定を再現した開発者メッセージで実行されました。¹¹ ClaudeモデルのHealthBench ProfessionalスコアはOpenAIが独自に評価したものです。¹³ ExploitGymは、AstraとSolについては6時間の時間制限なしで実行されました。¹⁷ FableのScreenSpot-ProとExploitGymのスコアは、セーフガードを抑えたFableであるMythosのものです。GPT-5.6 Solは、OpenAI API、Codex、ChatGPT Workで利用できるバージョンです。

OpenAI API標準料金

GPT-6 Astraは、開発者がOpenAI APIでgpt-6-astraとして利用できるほか、Microsoft AzureとAWS Bedrockからも利用できます。以下は公開されているAPI料金です。

入力トークン$10入力トークン100万個あたり
出力トークン$50出力トークン100万個あたり
Fastモード2xStandard処理の最大2倍の速度で、Standard価格の2倍

利用料は既存のChatGPTサブスクリプションの利用枠に含まれており、追加の利用分についてはユーザーや企業がクレジットを購入できます。キャッシュの読み書きには、別途公開されている料金が適用されます。適用要件を満たすAPI顧客にはZero Data Retentionを利用でき、OpenAIは顧客のプライバシーを保ちつつ安全性モニタリングを強化するPrivate Safety Processingをテストしています。

出典:OpenAIのGPT-6 Astraモデルページ(2026年9月4日)。

公開までの経緯

Astraが表面化してから公開されたすべての節目を時系列でまとめています。リンクはOpenAI自身のページに移動します。

  1. 2026年7月22日

    Hugging Faceインシデント

    評価中に、モデル由来のエージェントがサンドボックスを脱出してHugging Faceのインフラに到達しました。Astraは関与していませんが、OpenAIはこの教訓をAstraの安全策に活かしました。

  2. 2026年8月1日

    数学の問題10問を解決

    OpenAIが数学に関する研究記事で開示したところによると、次期モデルの内部バージョンが未解決だった10問で新たな成果を挙げ、証明はLeanで形式化されました。

  3. 2026年8月7日

    Critical評価を早期に開示

    OpenAIは、AstraがCriticalサイバー閾値を満たす可能性を排除できないと開示しました。同社がこの水準と評価した初のモデルであり、その後セーフガードの追加を開始しました。

    Preparedness Frameworkのアップデートを見る
  4. 2026年9月3日

    Path to Astraを公開

    公式投稿でモデル名が確定し、安全性に関する数値が公表され、リリースも発表されました。まず高度なサイバー機能、続いて完全なモデルという段階的な展開です。

    Path to Astraを読む
  5. 2026年9月3日

    Altmanが延期の理由を説明

    Sam Altmanは、Astraの公開が差し控えられたのは弱かったからではなく、強力すぎたからだと述べています。Astra以降のモデルについても、安全性のために時間が必要な場合には意図的に開発を遅らせるとしています。

  6. 2026年9月3日

    本日から利用可能

    GPT-6 Astraが公開され、Felo AI SearchとFelo APIで利用できるようになりました。search_modelにgpt-6-astraを指定するか、モデルカードを開くとクイックスタート用のコードを確認できます。

  7. 2026年9月4日

    完全なモデルページを公開

    OpenAIは完全なモデルページを公開しました。ベンチマーク結果、コンピュータ操作や専門業務における成果、APIの料金、展開計画が掲載されています。本日は限定された組織から提供が始まり、数日以内にすべてのChatGPT Plus、Pro、Business、Enterpriseユーザーに加え、OpenAI API、Microsoft Azure、AWS Bedrockにも展開されます。

    OpenAIのGPT-6 Astraページを読む

仕様の概要

2026年9月4日時点で確認されているGPT-6 Astraの情報です。

ステータス

2026年9月3日に安全性アップデートとともに公開され、9月4日に完全なモデルページが続きました。本日からは限られた組織への展開が始まり、その後すべてのChatGPT Plus、Pro、Business、Enterpriseユーザーに加え、OpenAI API、Microsoft Azure、AWS Bedrockへと広がります。Pro、Business、EnterpriseユーザーはGPT-6 Astra Proも利用できます。現在、Felo AI SearchとFelo APIで利用できます。

アーキテクチャ

報道では、再帰的なループ型トランスフォーマー設計とされています。OpenAIは製品ページでアーキテクチャやパラメータ数を公表しておらず、この設計も確認していません。主任科学者のJakub Pachockiは最も誇張された主張に異議を唱えています。流布している10兆パラメータという数値は未確認です。

Preparednessティア

Critical 、 サイバーカテゴリでこの水準に達した初のOpenAIモデルで、GPT-5.6 SolのHighより1つ上です。OpenAIはもっともアラインメントされたモデルとも説明しており、範囲外の行動は0%(Solは48%)でした。概念実証(PoC)エクスプロイトのような高度なサイバー任務は拒否します。OpenAI Daybreakを通じて、より制限の少ないセーフガードが今後提供される予定です。

サイバー能力

ExploitBenchで100%(GPT-5.6 Solは78.5%)、ExploitGymで42.4%(Solは30.3%)。SRE-Benchは1回の試行で88.0%、4回以内では99.2%で、GPT-5.6 Solは55.9%/68.7%でした。内部評価中にゼロデイ2件が発見され、維持者に開示されています。

展開計画

本日は限られた組織から提供を開始し、その後すべてのChatGPT Plus/Pro/Business/Enterpriseユーザーへと展開します。開発者向けにはOpenAI API(モデルID gpt-6-astra)、Microsoft Azure、AWS Bedrockを通じて提供されます。利用料は既存のサブスクリプションの利用枠に含まれ、追加クレジットも購入可能です。Pro、Business、EnterpriseユーザーはGPT-6 Astra Proも利用でき、Enterprise管理者はワークスペースごとにAstraを有効化できます 、 リリース時点ではデフォルトでオフです。高度なサイバー機能は引き続き制限されます。既定の本番構成は完全なサイバー能力なしで提供され、OpenAI Daybreakが今後数週間かけてアクセスの範囲を広げます。

既知の制約

ChatGPTとCodexのユーザーには、レビューが必要な保留中のアクションが表示されることがあります。また、APIジョブは不正利用モニターにフラグされた場合、停止することがあります。OpenAIは、Astraの書かれた推論がGPT-5.6 Solに比べて監視しにくくなったと指摘しており、モニタリングしやすさの改善を研究上の優先事項としています。正当な防御目的の作業が遅れる可能性もあります。

よくある質問

GPT-6 Astraは、2026年9月3日に公開されたOpenAIの新フラッグシップモデルです。OpenAIは、世界で最も知能が高く、最もアラインメントされたモデルだと説明しています。Preparedness FrameworkのサイバーカテゴリでCritical評価を受けた初のOpenAIモデルで、ExploitBenchでは100%、FrontierMath Tier 4では98%を記録、ARC-AGI-3では99.9%で上限に到達し、コンピュータ操作では最先端の記録を更新しました。

FeloでGPT-6 Astraを試す

OpenAIの新フラッグシップが利用可能になりました。ベンチマーク結果、コンピュータ操作や専門業務の記録、セーフガード、展開計画をご確認ください。Felo AI SearchをGPT-6 Astraに切り替えて、何でも質問してみてください。

Felo Astra Researchを試す

2026年9月3日公開