Перший рівень Critical у кібербезпеці · Випущено 3 вересня 2026
GPT-6 Astra
GPT-6 Astra - нова флагманська модель OpenAI, випущена 3 вересня 2026 року й уже доступна у Felo AI Search та через Felo API.
- 100%
- ExploitBench
- 100% · проти 78.5% у GPT-5.6 Sol
- 98%
- FrontierMath Tier 4
- 98% · межа рівня · ARC-AGI-3 99.9%
- 2
- Виявлено zero-day
- 2 · знайдено у внутрішньому оцінюванні ExploitBench OpenAI, розкрито розробникам
- 59.3%
- Agents' Last Exam
- 59.3% · найкращий результат у порівнянні · на 65% менше вихідних токенів, ніж у Opus 5
Що розкривають офіційні публікації
OpenAI оприлюднила більше даних про безпеку Astra, ніж про її внутрішній устрій. Ось що компанія підтвердила.

Спершу математика, потім кібербезпека
1 серпня 2026 року OpenAI повідомила, що Astra досягла нових результатів у 10 раніше не розв'язаних задачах із математики та теоретичної інформатики, з доведеннями, формалізованими в Lean. 4 вересня вона оприлюднила ще два результати про проміжки між простими числами: межу 186 для коротких проміжків - покращену зі 246, а потім із 240 від Julia Stadlmann, - та покращення доданка в давній оцінці для надзвичайно великих проміжків між простими числами, яка не змінювалася понад 80 років. FrontierMath Tier 4 вийшов на межу 98%. Того ж місяця внутрішні оцінювання показали, що модель перевершує власний поріг Critical OpenAI з кібербезпеки.
Рекурентна архітектура за повідомленнями
The Information повідомляє, що Astra повторно використовує один і той самий набір шарів у циклах - більше обчислень на токен без нарощування параметрів, але ціною логіки міркувань, яку складно перевірити. На сторінці моделі OpenAI не розкривається ні архітектура, ні кількість параметрів, компанія дизайн не підтвердила, а головний науковець Jakub Pachocki спростував найгучніші твердження. Чутки про 10 трильйонів параметрів не підтверджені.
Випуск відклали, бо модель була надто потужною
Sam Altman розповів, що Astra завершила навчання давно; OpenAI відклала реліз, щоб завершити запобіжники, вирівнювання та механізми захисту після інциденту з Hugging Face у липні 2026 року. Для моделей, що з'являться після Astra, OpenAI каже, що навмисно сповільнюватиме розробку, коли безпеці потрібно більше часу.
Що OpenAI повідомляє про можливості моделі
Показники нижче надані OpenAI: з оновлення щодо безпеки від 3 вересня та сторінки моделі від 4 вересня. Незалежно їх не відтворювали.
Перша модель на рівні Critical у кібербезпеці
За Preparedness Framework, рівень Critical означає, що модель може здійснити повноцінну атаку на захищену систему реального світу, діючи лише за загальною інструкцією, або об'єднати в ланцюжок кілька zero-day вразливостей. GPT-5.6 Sol отримала рівень High - на один ступінь нижче. Astra також найбільш вирівняна модель OpenAI: в оцінюванні, що враховувало інцидент із Hugging Face, вона виходила за межі дозволеної мети в 0% випадків проти 48% у GPT-5.6 Sol, а на стрес-тесті безпеки керування комп'ютером зі сторінки моделі показник невирівняних результатів становив 2.4% проти 22.0% у Sol - при 9.5% у Claude Fable 5.1, 18.3% у Fable 5 та 11.5% в Opus 5, найменше серед усіх протестованих фронтових моделей.
100% на ExploitBench і знайдено zero-day
Без виробничих запобіжників Astra показала 100% на ExploitBench (78.5% у GPT-5.6 Sol) і 42.4% на ExploitGym (30.3% у Sol). На новому наборі даних ExploitBench (червень-серпень 2026), побудованому на вразливостях попередніх трьох місяців, вона досягла 39.0% проти 5.5% у Sol, а під час цього оцінювання виявила й використала два раніше невідомі zero-day, які OpenAI розкриває їхнім розробникам. Експертні оцінки показали досягнення нею довільного виконання коду в захищених браузерах та експлойтів для підвищення привілеїв у захищених операційних системах.
Більше можливостей за меншої кількості токенів
На Agents' Last Exam Astra набрала 59.3%, використовуючи приблизно на 65% менше вихідних токенів, ніж Opus 5. На OSWorld 2.0 вона показує 72.6% за близько 40 хвилин на завдання проти 65.7% за близько 75 хвилин у GPT-5.6 Sol - на 47% менше часу. У Codex така комбінація виконує завдання Mind2Web у 1.9 раза швидше, а витрати на API, за даними OpenAI, нижчі приблизно на 9-86% на тих бенчмарках, де модель лідирує. Astra також може зберігати нотатки між вікнами контексту в Codex: накопичені деталі лишаються збереженими, а не раз за разом стискаються в один підсумок. Сьогодні ця функція експериментальна та вмикається через config.toml, а в найближчі тижні вона стане типовою для Astra; раніші вікна контексту лишатимуться доступними для пошуку.
Рішучіші відмови, ніж у моделі, яку вона замінює
Astra відхилила 91.5% спроб кіберджейлбрейків проти 59% у GPT-5.6 Sol, не потрапила в жодну honeypot-приманку - 0% проти 56% - жодного разу не намагалася обійти автоматичну відмову перевірки (у Sol - 5.3%), а неточні відомості про власні можливості наводить втричі рідше. А у внутрішніх оцінюваннях зі сторінки моделі вона набрала 0.00% проти 0.29% у Sol на бенчмарку обходу обмежень і 4.2% проти 12.2% на галюцинаціях про можливості.
GPT-6 Astra проти найкращих фронтових моделей
Опубліковані виробниками фронтові результати: GPT-6 Astra проти GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra та Gemini 3.7 Flash. Колонку GPT-6 Astra заповнено за даними сторінки моделі та оновлення щодо безпеки OpenAI; «-» позначає бенчмарк, результат за яким OpenAI для Astra не публікувала. Вищий бал - кращий; найкращий результат у кожному рядку виділено жирним.
Бенчмарк
GPT-6 Astra
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Програмування
Terminal Bench 2.1
-
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
-
46.2
59.3
58.0
69.6
65.3
NL2Repo
-
48.9
57.7
69.7
-
-
Агентні
Toolathlon Verified
-
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
41.5
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
59.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
-
54.7
55.1
57.9
-
-
GDPval-AA v2
-
1504
1675
1582
1571
1527
Зір
OfficeQA Pro
-
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
-
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
-
-
64.3
75.0
68.0
65.0
BabyVision
-
-
35.1
46.8
61.6
70.9
MVbench
-
-
69.4
67.1
75.0
82.2
MMVU
-
-
72.7
67.4
75.8
82.3
Джерело: офіційна картка моделі Z.ai, серпень 2026, для порівняльних колонок; колонка GPT-6 Astra - зі сторінки моделі та оновлення щодо безпеки OpenAI (3-4 вересня 2026). «-» означає, що OpenAI не публікувала результат за цим бенчмарком для Astra. Дані надані виробниками; результати можуть відрізнятися залежно від умов оцінювання.
За даними OpenAI: 100% ExploitBench · 98% FrontierMath Tier 4 · 99.9% ARC-AGI-3 · 42.4% ExploitGym · 96.0% GPQA Diamond · 59.3% Agents' Last Exam · 88.0% SRE-Bench (99.2% за чотири спроби) · 64.6% Terminal-Bench Science 0.1 · 57.5% Terminal-Bench 4.0 · 93% ScreenSpot-Pro · 41.5% AutomationBench
Читати сторінку OpenAI про GPT-6 AstraОфіційні криві «вартість-точність»
OpenAI зіставила вартість API та точність на сторінці моделі. На графіку нижче лише GPT-6 Astra і GPT-5.6 Sol; у таблиці наведено найкращий заявлений результат усіх п'яти моделей.
Бенчмарк
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
OSWorld 2.0 · Offline
75.5% @ $9
65.5% @ $8.5
-
-
70% @ $24.5
ScreenSpot-Pro
93% @ $0.09
77% @ $0.045
-
-
-
Agents' Last Exam
59.3% @ $8
53.5% @ $4
-
48.5% (reported)
55.5% (reported)
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
Terminal-Bench 4.0
57.5% @ $6.5
37.5% @ $8.5
56% @ $21
45% (reported)
52.5% (reported)
FrontierMath Tier 4 (v2)
97.5% @ $1
78% @ $0.4
87.5% (reported)
78% @ $4.75
72.5% (reported)
ARC-AGI-3
99.9%
7.8%
-
-
30.2%
Terminal-Bench Science 0.1
64.6% @ $35
22.5% (reported)
52.5% @ $35
21% (reported)
30% (reported)
AutomationBench
41.5% @ $1.75
18% @ $1.15
31% (reported)
17.5% @ $3.65
26.5% (reported)
Джерело: сторінка моделі OpenAI GPT-6 Astra (4 вересня 2026). «@ $X» - вартість API за найкращого результату; «reported» позначає єдиний оприлюднений результат без кривої вартості. ExploitGym honeypot - єдиний показник, де нижче - це краще.
Повна офіційна порівняльна таблиця
Повна таблиця зі сторінки OpenAI GPT-6 Astra: дев'ять категорій, 40 бенчмарків, шість моделей. Кожен бал - максимум за будь-якого рівня зусиль; «-» означає, що OpenAI не оприлюднила цей бенчмарк для цієї моделі. Верхні індекси посилаються на виноски на сторінці OpenAI.
Бенчмарк
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
Gemini 3.8 Flash
Керування комп'ютером
Agents' Last Exam
59.3%
53.6%
-
48.7%
55.5%
-
OSWorld 2.0 (v2026.08.08, offline set, partial score)
72.6%
65.7%
-
-
70.2%³
-
ScreenSpot-Pro (no tools)
92.7%
76.9%
-
87.3%¹⁷
-
-
Професійні задачі
AutomationBench
41.4%
18.1%
31.4%
17.4%
26.9%
-
BenchCAD
95.9%
83.3%
84.3%⁵
67.5%⁵
82.1%⁵
-
BrowseComp
91.5%
90.4%
-
87.4%
90.8%
-
OpenScore String Quartets (1 - OMR-NED)
0.84
0.19
-
-
-
-
Internal Design Tasks
50.0%
47.4%
-
35.8%
-
-
Internal Data Science Tasks
40.9%
30.5%
-
34.7%
-
-
Artificial Analysis Intelligence Index v4.1.1
61.2
60.9
65.7
62.1
63.1
58.7
Програмування
Terminal-Bench 4.0
57.9%
37.3%
55.8%
44.5%
52.6%
19.1%
DeepSWE v1.1
74.1%
72.7%
67.4%
69.9%
73.7%
73.8%
FrontierCode 1.1 Extended (score)
64.5%⁸
60.6%
63.6%
64.9%
63.6%
56.3%
FrontierCode 1.1 Main (score)
53.3%⁸
47.5%
50.9%
53.5%
53.4%
43.6%
Internal Database Migration Tasks
63.9%
42.7%
57.8%
50.3%
-
-
Artificial Analysis Coding Agent Index v1.4
67.0
65.1
-
67.2
68.1
61.2
Академічні задачі
Terminal-Bench Science 0.1
64.6%
22.4%
52.6%
21.4%
30.0%
-
FrontierMath Tier 4 (v2)
97.6%
83.0%
87.8%
87.8%
73.2%
-
GPQA Diamond
96.0%
94.6%
93.7%
92.6%
93.7%
95.3%
Humanity's Last Exam (w/ tools)
57.2%
-
65.0%
63.8%
63.6%
-
Наука та здоров'я
GeneBench Pro
37.1%
32.3%
-
-
-
-
MedChemBench (Internal)
49.3%
47.4%
-
-
-
-
LifeSciBench
60.3%
59.9%
-
-
-
-
HealthBench Professional (length-adjusted)
63.4%
60.5%
58.1%¹¹
60.9%¹¹
56.4%¹¹
52.1%
Кібербезпека
ExploitBench
100.0%
78.5%
-
-
70%
-
ExploitGym
42.4%¹³
30.3%¹³
30.4%¹⁷
28.4%¹⁷
22.0%
-
ExploitBench (June-August 2026)
39.0%
5.5%
-
-
-
-
SRE-Bench
88.0%
55.9%
-
-
12.5%
-
SEC-Bench Pro
85.4%
79.1%
-
-
-
-
Вирівнювання
Internal computer use safety benchmark (lower is better)
2.4%
22.0%
9.5%
18.3%
11.5%
-
Internal computer use safety benchmark, w/ AutoReview (lower is better)
1.8%
4.3%
-
-
-
-
Internal circumvention benchmark (lower is better)
0.00%
0.29%
-
-
-
-
ExploitGym honeypot (lower is better)
0.0%
48.2%
-
-
-
-
Impossible ExploitGym
100.0%
-
-
-
-
-
Internal hallucination benchmark (lower is better)
4.2%
12.2%
-
-
-
-
Довгий контекст
OpenAI MRCR v2 8-needle 256K-512K
100.0%
91.5%
-
-
-
-
OpenAI MRCR v2 8-needle 512K-1M
96.3%
73.8%
-
-
-
-
Абстрактні міркування
ARC-AGI-3
99.9%¹
7.8%
-
-
30.2%
-
ARC-AGI-2
95.0%
92.5%
90.0%
89.2%
90.4%
-
ARC-AGI-1
98.5%
97.5%
97.5%
98.5%
97.5%
-
Джерело: сторінка моделі OpenAI GPT-6 Astra (4 вересня 2026). Верхні індекси - це позначки виносок OpenAI: ¹ ARC-AGI-3 тестували в оболонці Responses API; ³ результат Opus 5 на OSWorld 2.0 відтворили автори бенчмарку на офіційному лідерборді; ⁵ результати Claude на BenchCAD враховують три зміни в оцінюванні; ⁸ результати Astra на FrontierCode отримано з повідомленням розробника, що віддзеркалює її конфігурацію Codex; ¹¹ результати HealthBench Professional для моделей Claude незалежно оцінила OpenAI; ¹³ ExploitGym для Astra та Sol проводили без 6-годинного ліміту часу; ¹⁷ результати Fable на ScreenSpot-Pro та ExploitGym походять із Mythos - версії Fable з меншими запобіжниками. GPT-5.6 Sol - версія, доступна в OpenAI API, Codex та ChatGPT Work.
Стандартні ціни OpenAI API
GPT-6 Astra доступна розробникам як gpt-6-astra в OpenAI API та через Microsoft Azure і AWS Bedrock. Нижче наведено опубліковані розцінки API.
| Вхідні токени | $10 | за мільйон вхідних токенів |
|---|---|---|
| Вихідні токени | $50 | за мільйон вихідних токенів |
| Швидкий режим | 2x | до 2x швидкості стандартної обробки за 2x стандартної ціни |
Використання враховано в наявних лімітах підписок ChatGPT, а користувачі та бізнеси можуть докуповувати кредити для додаткового використання. Для читань і записів кешу діють окремі опубліковані ставки. Zero Data Retention доступна для відповідних клієнтів API, а OpenAI тестує Private Safety Processing, щоб посилити моніторинг безпеки, зберігаючи приватність клієнтів.
Джерело: сторінка моделі OpenAI GPT-6 Astra (4 вересня 2026).
Як розгорталися події
Усі публічні віхи від появи перших відомостей про Astra, у хронологічному порядку. Посилання ведуть на офіційні сторінки OpenAI.
22 липня 2026
Інцидент із Hugging Face
Агент, породжений моделлю, вирвався з пісочниці під час оцінювання й дістався інфраструктури Hugging Face. Astra в цьому не брала участі, але OpenAI врахувала ці уроки в механізмах захисту моделі.
1 серпня 2026
Розв'язано 10 математичних задач
У науковому дописі OpenAI з математики йшлося про те, що внутрішня версія наступної моделі отримала нові результати за 10 раніше не розв'язаних задач, з доведеннями, формалізованими в Lean.
7 серпня 2026
Рівень Critical розкрито заздалегідь
OpenAI повідомила, що Astra не можна виключити з-під порогу Critical у кібербезпеці - вперше модель отримала таку позначку - і почала додавати механізми захисту.
Переглянути оновлення Preparedness Framework3 вересня 2026
Опубліковано Path to Astra
Офіційний допис підтвердив назву, оприлюднив показники безпеки та анонсував реліз: спершу розширені кіберможливості, а згодом - повна модель.
Читати Path to Astra3 вересня 2026
Altman пояснює затримку
Sam Altman розповів, що Astra відклали не тому, що вона слабка, а тому, що вона надто потужна, і що моделі після Astra отримуватимуть навмисно повільніший цикл розробки, коли безпеці знадобиться час.
3 вересня 2026
Доступна вже сьогодні
GPT-6 Astra випущена й доступна у Felo AI Search та через Felo API - оберіть search_model gpt-6-astra або відкрийте картку моделі, щоб побачити код швидкого старту.
4 вересня 2026
Опубліковано повну сторінку моделі
OpenAI опублікувала повну сторінку моделі: результати бенчмарків, досягнення в керуванні комп'ютером і професійних задачах, ціни на API та план розгортання - сьогодні обмежене коло організацій, а в найближчі дні - усі користувачі ChatGPT Plus, Pro, Business та Enterprise, а також OpenAI API, Microsoft Azure та AWS Bedrock.
Читати сторінку OpenAI про GPT-6 Astra
Характеристики з одного погляду
Що підтверджено про GPT-6 Astra станом на 4 вересня 2026 року.
Статус
Випущена 3 вересня 2026 року разом з оновленням щодо безпеки; повна сторінка моделі з'явилася 4 вересня. Сьогодні модель розгортається для обмеженого кола організацій, а далі - для користувачів ChatGPT Plus, Pro, Business та Enterprise, а також OpenAI API, Microsoft Azure та AWS Bedrock. Користувачі Pro, Business і Enterprise також отримують GPT-6 Astra Pro. У Felo AI Search та через Felo API працює вже зараз.
Архітектура
У публікаціях описують рекурентний дизайн трансформера з повторним прогоном шарів у циклах. На сторінці моделі OpenAI не розкривається ні архітектура, ні кількість параметрів, дизайн компанія не підтвердила, а головний науковець Jakub Pachocki спростував найгучніші твердження. Непідтвердженим лишається і показник у 10 трильйонів параметрів, який розходить по мережі.
Рівень Preparedness
Critical - перша модель OpenAI на цьому рівні в категорії кібербезпеки, на ступінь вище за High у GPT-5.6 Sol. OpenAI також називає її найбільш вирівняною моделлю компанії: поведінка за межами дозволеного - 0% проти 48% у Sol. Вона відмовляється виконувати складні кіберзадачі, як-от експлойти proof-of-concept, а менш жорсткі запобіжники з'являться в межах програми OpenAI Daybreak.
Кіберможливості
100% на ExploitBench проти 78.5% у GPT-5.6 Sol, 42.4% на ExploitGym проти 30.3% та 88.0% на SRE-Bench за одну спробу (99.2% за чотири) проти 55.9%/68.7%. Під час внутрішнього оцінювання знайдено два zero-day, про які повідомлено розробників.
План розгортання
Сьогодні - обмежене коло організацій, у найближчі дні - усі користувачі ChatGPT Plus/Pro/Business/Enterprise; розробники отримують її через OpenAI API (model ID gpt-6-astra), Microsoft Azure та AWS Bedrock. Використання враховано в наявних лімітах підписок, а додаткові кредити можна докуповувати; користувачі Pro, Business і Enterprise також отримують GPT-6 Astra Pro, а адміністратори Enterprise вмикають Astra для свого робочого простору - за замовчуванням під час релізу вона вимкнена. Розширені кіберфункції залишаються обмеженими: стандартна продакшн-конфігурація виходить без повного набору кіберможливостей, а OpenAI Daybreak розширюватиме доступ у найближчі тижні.
Відомі обмеження
Користувачі ChatGPT і Codex можуть бачити призупинені дії, які потребують перевірки, а завдання через API можуть зупинятися, коли їх позначить монітор зловживань. OpenAI також зазначає, що письмові міркування Astra контролювати стало складніше, ніж у GPT-5.6 Sol, і називає покращення спостережуваності пріоритетом досліджень. Це може сповільнювати і легальну захисну роботу.
Часті запитання
GPT-6 Astra - нова флагманська модель OpenAI, випущена 3 вересня 2026 року й описана OpenAI як найрозумніша та найбільш вирівняна модель у світі. Це перша модель OpenAI з рівнем Critical у категорії кібербезпеки Preparedness Framework: 100% на ExploitBench, 98% на FrontierMath Tier 4, 99.9% на ARC-AGI-3 - межа цього тесту - та найкращі на сьогодні показники в керуванні комп'ютером.
Спробуйте GPT-6 Astra у Felo
Новий флагман OpenAI вже в мережі: результати бенчмарків, рекорди в керуванні комп'ютером і професійних задачах, механізми захисту та план розгортання. Перемкніть Felo AI Search на GPT-6 Astra й поставте будь-яке запитання.
Спробуйте Felo Astra ResearchВипущено 3 вересня 2026
