OpenAI представила GPT-6 Astra 3 сентября 2026 года. Я разбираю релиз по состоянию на 5 сентября: что заявляет разработчик, что проверили независимые исследователи и какие выводы из этого можно сделать для бизнеса. Для меня главный вопрос — помогает ли новая модель доводить поручение до проверяемого результата.
Что это за модель
В официальном анонсе OpenAI Astra позиционируется как новое поколение моделей для сложной профессиональной работы, программирования и управления компьютером. Среди примеров — действия в CRM, работа с документами и проверка сайтов. Компания объявила поэтапное предоставление доступа; дата анонса не означает одновременное появление модели у каждого пользователя.
Модель сама по себе не составляет готовую автоматизацию. Чтобы ИИ-агент выполнял бизнес-задачу, ему нужны инструменты, данные, разрешения и критерии завершения. Это различие особенно важно при чтении демонстраций: красивый результат в подготовленной среде ещё нужно воспроизвести в собственном процессе.
Что показывают тесты OpenAI
OpenAI сообщает о 98% на FrontierMath Tier 4 и 100% на ExploitBench. Второй результат сравнивается с 78,5% у GPT-5.6 Sol; речь идёт о специальном тесте кибервозможностей без производственных защит, а не о доступной каждому функции.
Ближе к офисной практике сравнение OSWorld 2.0: в симуляции задержек Astra набрала 72,6% при примерно 40 минутах на задачу, Sol — 65,7% при примерно 75 минутах. Это измерение конкретного испытания, а не обещание вдвое ускорить любую работу.
В том же анонсе Cognition положительно оценивает работу Astra в Devin, а Lovable — проверку создаваемых приложений. Это отзывы ранних партнёров, опубликованные разработчиком модели; их полезно читать отдельно от независимого рейтинга. Источник результатов и отзывов — OpenAI.
Лучше ли Astra предшественников и конкурентов
Artificial Analysis провела собственное сравнение. Оно показывает неоднородный прогресс.
- В Coding Agent Index Astra набрала 67 — примерно уровень Fable 5 и Opus 5. Fable 5.1 получила 70.
- В Intelligence Index Astra и GPT-5.6 Sol получили по 61, Fable 5.1 — 66.
В первом индексе сравниваются модели в соответствующих рабочих оболочках, включая Codex и Claude Code. В проверке программирования Astra на максимальном усилии использовала примерно втрое меньше токенов, чем Sol, и показала более высокий результат при сопоставимой стоимости задания.
Однако в общем Intelligence Index сопоставимое качество сопровождалось примерно на 75% большей стоимостью задания. Исследователи также отмечают улучшение AA-Briefcase и ухудшение GDPval-AA v2. Поэтому утверждение «Astra лучше всех во всём» эти результаты не поддерживают.
Для выбора я бы сравнивал один и тот же набор рабочих заданий: правильность результата, время, число исправлений человеком и итоговую стоимость. Место в рейтинге помогает составить список кандидатов, но не заменяет такую проверку.
Почему у ARC-AGI-3 сразу два результата
ARC Prize опубликовала собственный разбор Astra. В стандартном окружении модель получила 62,7%, а с адаптером провайдера — 99,9%. Эти числа относятся к разным условиям и уровням вычислительного усилия; их нельзя смешивать в одно универсальное свойство модели.
Адаптер сохраняет внутреннее состояние рассуждения между запросами и управляет длинным контекстом. В стандартной среде модель должна сама выбирать, какую информацию переносить в видимых заметках. Получается, что проверяется не только модель, но и способ организации её работы.
ARC Prize отдельно поясняет: насыщение этого теста не является доказательством достижения общего искусственного интеллекта. На мой взгляд, практический вывод важнее громкой формулировки: память, инструменты и сохранение состояния способны существенно менять результат ИИ-агента. При внедрении эти части системы стоит оценивать вместе.
Что это означает для бизнеса
Я бы начал с одного процесса, где можно сохранить исходное задание и независимо проверить результат. Например, подготовить черновик документа по утверждённым данным, собрать отчёт или проверить работу формы. Для каждого сценария заранее нужен список того, что считается ошибкой и какие действия требуют согласования.
Такой подход описан в материале о выборе процесса для первого AI-пилота. После пробного запуска полезно отдельно провести приёмку ИИ-агента по рабочему результату, сохранив примеры успешных и неудачных заданий.
В этой статье я не выдаю опубликованные тесты за собственный эксперимент Alek IT Lab. Для конкретного внедрения основанием перехода на Astra должен стать повторяемый выигрыш на выбранном процессе. Если он проявляется только в части задач, модель можно оценивать именно для этой части, не меняя автоматически весь рабочий процесс.
