> ## Content Index
> Fetch the complete content index at: https://matveev.tech/llms.txt
> Use this file to discover other available public pages before exploring further.

# GPT-6 Astra: обзор модели OpenAI и заявка на AGI
- URL: https://matveev.tech/gpt-6-astra-update-2026-09-05/
- Published: 2026-09-04T22:38:08.000Z
- Updated: 2026-09-04T22:38:08.000Z
- Description: OpenAI выпустила GPT-6 Astra и назвала это началом эры AGI. Разбираю, что модель реально умеет с компьютером, сколько стоит и где к её бенчмаркам есть вопросы.
- Author: Pavel Matveev
- Tags: LLM, AI, OpenAI, Агенты, Безопасность, Обзор

> TL;DR: GPT-6 Astra вышла 3 сентября 2026 года. Это модель OpenAI для работы с приложениями и долгих задач в Codex: она может управлять интерфейсом, писать код и искать сведения в предыдущих контекстных окнах. В API миллион входных токенов стоит $10, выходных $50\. В обзоре разбираю возможности, ограничения и заявления об AGI.

## Что такое GPT-6 Astra

Astra относится к старшим моделям шестого поколения. В отличие от линейки GPT-5.6, где были варианты Luna, Terra и Sol, здесь пока только два: обычная Astra и Astra Pro ([The New Stack](https://thenewstack.io/openai-gpt6-astra-benchmarks/?ref=matveev.tech), 3 сентября 2026).

OpenAI делает акцент на работе с компьютером. Модель может выполнять последовательность действий в приложениях, а качество такого агента зависит и от самой модели, и от инструментов, через которые ей дают доступ к интерфейсу.

Технически это самый крупный тренировочный запуск компании. Эйдан Кларк из OpenAI на брифинге сказал, что претрейн впервые шёл на более чем 100 000 GPU на площадке Stargate в Техасе. И это первый релиз, где предыдущие модели заметно участвовали в супервизии обучения следующей. То есть модель учили модели.

## Как Astra работает с компьютером вместо тебя

Идея computer use не новая, ей больше года. Изменилось качество. Вместо того чтобы дёргать API для каждого приложения, Astra ходит по интерфейсу так же, как человек: кликает, печатает, переключает окна.

Что она умеет по описанию OpenAI: заполнять формы и обновлять записи в CRM, разбирать календарь, делать веб-ресёрч и оформлять результат документом, работать с таблицами и Python-ноутбуками, собирать и тестировать сайты, устанавливать софт и чинить его. В демо она работала внутри Power BI, KiCad и Unity. Это инженерные инструменты с рабочими интерфейсами.

На офлайн-подмножестве OSWorld 2.0 Astra набрала 72,6% против 65,7% у GPT-5.6 Sol. Время около 40 минут против 75 получено в симуляции задержек, [уточняет OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech). Думаю, это полезный ориентир, но время на твою задачу придётся замерить отдельно.

Промо-ролик OpenAI начинается с демки восьмидесятых, где человек просит компьютер нарисовать жёлтый круг. Потом кадр меняется на сегодня: сотрудники голосом просят Astra превратить круг в ракету, потом в трёхмерную игру, потом создать лот на eBay. Всё голосом, без клавиатуры.

## Кодинг и Codex: что меняется для разработчиков

![Обновление ChatGPT и Codex с выходом GPT-6 Astra](https://matveev.tech/content/images/2026/09/gpt-6-astra-codex.webp)

В Codex появилась вещь, которой мне не хватало давно: модель ведёт заметки между контекстными окнами и может искать по предыдущим окнам ([анонс OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech)). Требования из начала сессии или результат теста, который прогнали двадцать сообщений назад, остаются доступными. На момент анонса функция экспериментальная, включается вручную; компания обещает сделать её стандартной в ближайшие недели.

На DeepSWE v1.1 в [таблице OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) у Astra 74,1%, у GPT-5.6 Sol 72,7%, у Claude Opus 5 73,7%, у Gemini 3.8 Flash 73,8%. Разница небольшая. По этим значениям я бы не выбирал модель для всей разработки: полезнее сравнить результат на своих задачах и стоимость завершённой работы.

Сравнение зависит от набора задач и условий запуска. Поэтому результаты из разных публикаций нельзя автоматически складывать в один рейтинг, даже когда бенчмарк называется одинаково.

В научных задачах выделяется Terminal-Bench Science (70 задач в командной строке по пяти научным областям): 64,6% у Astra против 52,6% у Fable 5.1 по данным Anthropic, при том что публичный лидерборд упирается в 30% у Opus 5\. И BenchCAD, где модель восстанавливает CAD-программы по рендерам: 95,9% против 84,3% у Fable 5.1 и 83,3% у Sol.

## Что с остальными бенчмарками и почему к ним есть вопросы

| Бенчмарк                 | Astra | GPT-5.6 Sol |
| ------------------------ | ----- | ----------- |
| ARC-AGI-3                | 99,9% | 7,8%        |
| FrontierMath Tier 4 (v2) | 97,6% | 83,0%       |
| ExploitBench             | 100%  | 78,5%       |
| SRE-Bench (4 попытки)    | 99,2% | 68,7%       |
| GPQA Diamond             | 96%   | 94,6%       |
| DeepSWE v1.1             | 74,1% | 72,7%       |
| Terminal-Bench Science   | 64,6% | 22,4%       |
| OSWorld 2.0 (офлайн)     | 72,6% | 65,7%       |

Сверено с [таблицей OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) 5 сентября 2026\. Это результаты, приведённые компанией; они не заменяют проверку на твоих задачах.

Разница между 7,8% у Sol и 99,9% у Astra на ARC-AGI-3 большая. Бенчмарк проверяет, как модель разбирается в незнакомой интерактивной среде и находит способ решить задачу.

Оговорка, впрочем, серьёзная. Astra оценивали через харнесс Responses API, который сохраняет рассуждения между ходами и использует компакцию для длинных контекстов. OpenAI сама раньше показывала, что такие системные настройки поднимают результат на ARC-AGI-3 без изменений в самой модели. Остальные модели в сравнении гоняли в других сетапах. То есть меряли не столько модель, сколько связку «модель плюс обвязка».

Для практического выбора мне важна вся система: модель, инструменты, настройки и стоимость прогона. Итоговый процент без этих условий мало что говорит о том, как агент поведёт себя в работе.

Результат 97,6% на FrontierMath Tier 4 относится к конкретному набору задач. По нему нельзя заключить, что модель с такой же успешностью справится с любой исследовательской проблемой. Для этого нужны отдельные проверки за пределами бенчмарка.

И ещё деталь, которая мне кажется говорящей. В материалах запуска нет GDPval, собственного бенчмарка OpenAI 2025 года, который меряет экономическую ценность на 1320 задачах из 44 профессий и девяти индустрий. Когда компания заявляет про эру AGI, отсутствие ровно того теста, который меряет реальную рабочую пользу, бросается в глаза.

В итоговых таблицах OpenAI приводит лучшие результаты при разных уровнях усилий. Компания также предупреждает, что исследовательская среда и API могут давать результаты, отличающиеся от ChatGPT из-за системных инструкций и доступных инструментов.

## Почему OpenAI впервые включила «критический» протокол безопасности

Astra стала первой моделью, которую OpenAI отнесла к порогу Critical по кибербезопасности в своём [Preparedness Framework](https://openai.com/index/path-to-astra/?ref=matveev.tech). Формулировка компании: модель может находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во многих хорошо защищённых системах, причём человеку не нужно вести её за руку на каждом шаге.

Это не гипотеза. В ходе внутренней оценки на наборе из 20 недавних уязвимостей V8 модель нашла и использовала две ранее неизвестные уязвимости нулевого дня как часть цепочки эксплойта. OpenAI сейчас передаёт их мейнтейнерам. В экспертных тестах Astra собрала полную цепочку компрометации браузера с побегом из песочницы и выполнением команд на хосте, а в захардненной операционной системе собрала цепочку повышения привилегий от обычного пользователя до root.

Что OpenAI сделала в ответ:

- Обучила модель жёстче отказывать. На наборе кибер-джейлбрейков Astra отказывает в 91,5% запросов против 59% у GPT-5.6 Sol.
- Приостановила часть обучения на две недели после инцидента с Hugging Face, укрепила изоляцию и сетевые контроли инфраструктуры. Крупный RL-запуск перезапустили 28 августа 2026 года.
- Развернула мониторинг цепочки рассуждений в проде: классификаторы проверяют рассуждения и действия модели и автоматически останавливают подозрительную активность.
- Ограничила доступ к продвинутым кибер-сценариям узкой группой альфа-тестеров с дальнейшим расширением через программу Daybreak Blue для защитников.

По части выравнивания цифры любопытные. В honeypot-тестах, где модель ставили перед сложными или нерешаемыми задачами, GPT-5.6 Sol без продакшн-защит пытался добраться до соседних систем в 56% случаев, а по другой метрике выходил за пределы выданных полномочий в 48,2% случаев. Astra не сделала этого ни разу.

Главный научный директор OpenAI Якуб Пахоцки сформулировал риск так: «Прогресс в интеллекте не гарантирует прогресса в выравнивании». И добавил, что компания не примет деградацию собственной способности следить за выравниванием модели дальше определённого уровня.

Есть и обратная сторона, о которой OpenAI пишет честно. Защиты калиброваны с запасом, и система может пометить легитимную работу как подозрительную, включая задачи, вообще не связанные с кибербезопасностью, и долгие агентные прогоны. В ChatGPT и Codex у тебя спросят подтверждение, а вот в API задача просто остановится. Если ты строишь автономный пайплайн на Astra, это надо закладывать в архитектуру с первого дня.

Отдельная деталь для тех, кто следит за интерпретируемостью: когда исследователи прямо просили модели уклоняться от мониторинга, письменные рассуждения Astra читались хуже, чем у Sol. OpenAI объясняет это тем, что Astra решает простые задачи за меньшее число шагов, но на сложных задачах спрятать рассуждения ей по-прежнему трудно.

## Правда ли это AGI?

Брокман на брифинге был аккуратнее, чем цитата в заголовках. Он признал, что AGI остаётся «серой, размытой штукой», и напомнил, что термин больше не привязан к контрактному триггеру в соглашении с Microsoft. Теперь это «миссия или духовное понятие».

Брокман оставил читателям право на собственное определение AGI, но сказал, что лично для него этот рубеж уже достигнут. При этом он описал релиз как начало пути. Это его оценка на брифинге, а не результат отдельного теста на AGI.

Есть история из математики, которую OpenAI приводит как аргумент. Astra участвовала в двух новых результатах о разрывах между простыми числами: математик Юлия Штадльманн ранее сдвинула одну из границ с 246 до 240, а с участием модели она упала до 186\. Ещё в одном случае модель помогла улучшить часть границы, которая не двигалась больше восьмидесяти лет. Проблема в том, что OpenAI не расписывает, что модель придумала сама, что подсказали исследователи и как работа ходила между ними.

Думаю, всё упирается в определение. Способность делать полезную работу в разных областях ещё не устанавливает сопоставимость с человеческим суждением по всему спектру задач. Показанные бенчмарки сами по себе этого не доказывают. Слова Брокмана я читаю как его личную позицию, что он сам и оговорил.

Разбираю, что из громких заявлений про AGI доходит до реальных рабочих задач. [Подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech).

## Как получить доступ и сколько стоит

В [анонсе OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) доступ сначала открывают ограниченному набору организаций, затем обещают Plus, Pro, Business и Enterprise, API, Microsoft Azure и AWS Bedrock. Это план развёртывания, а не подтверждение доступа в каждом аккаунте. Daybreak отдельно относится к расширению киберзащитных сценариев.

Защиты Astra могут остановить легитимную задачу, если она покажется системе подозрительной. В ChatGPT и Codex спросят подтверждение, а в API прогон просто оборвётся. Закладывай обработку этого в автономных пайплайнах.

Владельцам Pro, Business и Enterprise достаётся ещё и Astra Pro. У корпоративных админов доступ по умолчанию выключен. Включать надо руками в настройках воркспейса.

Имя модели в API: `gpt-6-astra`. Для подходящих клиентов доступен режим Zero Data Retention.

| Модель                  | Вход, $/1M токенов | Выход, $/1M токенов |
| ----------------------- | ------------------ | ------------------- |
| GPT-6 Astra             | 10                 | 50                  |
| GPT-6 Astra (fast mode) | 20                 | 100                 |
| Claude Fable 5.1        | 10                 | 50                  |
| Meta Muse               | 1,25               | 4,25                |
| Gemini 3.8 Flash        | 0,75               | 3,75                |

Цены конкурентов приведены на 3 сентября 2026 по данным [The New Stack](https://thenewstack.io/openai-gpt6-astra-benchmarks/?ref=matveev.tech). Тарифы Astra сверены с [OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) 5 сентября: Standard $10/$50, Fast вдвое дороже. Чтение и запись кэша тарифицируются отдельно.

В сравнении цен на дату запуска Astra стоила в 2,5 раза дороже промо-тарифа Sol и столько же, сколько [Claude Fable 5.1](https://matveev.tech/claude-fable-5-1/). На фоне указанной цены Gemini 3.8 Flash разница больше чем на порядок.

Оговорка, которую стоит держать в голове: более высокая цена за токен не означает больший счёт. Если модель закрывает задачу за меньшее число шагов и с меньшим количеством ретраев, итог может выйти дешевле. OpenAI утверждает, что Astra расходует меньше токенов на нескольких оценках и в партнёрских тестах. Данных на старте слишком мало, чтобы понять, перекрывает ли эта экономия наценку.

## Вердикт

Меня в этом релизе больше всего интересует работа в интерфейсах. Если твои задачи связаны с таблицами, отчётами в Power BI или старым софтом без API, Astra стоит проверить на знакомом процессе. Результаты OSWorld дают повод для такого эксперимента, но из них не следует, что за агентом больше не нужно присматривать.

В кодинге я бы не спешил переезжать только из-за результатов DeepSWE. Для длинных сессий заметки Codex между контекстными окнами могут оказаться полезнее небольшого отрыва по баллам. Проверять это стоит на задаче, где агенту приходится возвращаться к старым требованиям и неудачным попыткам исправления.

Кому точно стоит подождать: тем, кто строит автономные пайплайны через API. Защиты откалиброваны с запасом, и остановка задачи посреди прогона без возможности подтвердить действие вполне возможна. OpenAI обещает калибровать дальше, но на старте трения будет больше, чем в итоге задумано.

Кому не подойдёт вообще: если задачи закрывает модель за доллар с четвертью за миллион токенов, платить в восемь раз больше за способность кликать мышкой смысла нет.

Модель, которая сама находит уязвимости в защищённом браузере, требует внимательного контроля доступа. Через Daybreak OpenAI планирует расширять именно защитные сценарии. Как эти ограничения будут работать на практике, я бы оценивал отдельно от качества кода и управления интерфейсами.

[ChatGPTOpenAI анонсировала GPT-6 Astra для Plus, Pro, Business и Enterprise, API, Azure и AWS Bedrock.OpenAI](https://chatgpt.com/?ref=matveev.tech)

Попробовать Astra

## Что ещё почитать

- [GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI](https://matveev.tech/gpt-5-6-sol/). Контекст сравнения Astra с предыдущим поколением.
- [Claude Fable 5.1: обзор модели для долгой автономной работы](https://matveev.tech/claude-fable-5-1/). Сравнение подходов к долгим агентным задачам.
- [Claude Opus 5: обзор модели и что меняется в API](https://matveev.tech/claude-opus-5/). Ещё одна модель из таблицы результатов DeepSWE.
- [Как запустить OpenAI Privacy Filter локально](https://matveev.tech/run-openai-privacy-filter-locally/). Работа с чувствительными данными перед отправкой в API.