Статья

GPT-6 Astra: что теперь может ИИ-агент и что говорят тесты

Вышла GPT-6 Astra. В программировании есть заметный прогресс, но независимые тесты не подтверждают лидерство во всех задачах. Разбираю результаты и условия сравнений.

5 минутАвтор: Алек Ампир
Иллюстрация направления ИИ-агентов Alek IT Lab

OpenAI представила GPT-6 Astra 3 сентября 2026 года. Я разбираю релиз по состоянию на 5 сентября: что заявляет разработчик, что проверили независимые исследователи и какие выводы из этого можно сделать для бизнеса. Для меня главный вопрос — помогает ли новая модель доводить поручение до проверяемого результата.

Что это за модель

В официальном анонсе OpenAI Astra позиционируется как новое поколение моделей для сложной профессиональной работы, программирования и управления компьютером. Среди примеров — действия в CRM, работа с документами и проверка сайтов. Компания объявила поэтапное предоставление доступа; дата анонса не означает одновременное появление модели у каждого пользователя.

Модель сама по себе не составляет готовую автоматизацию. Чтобы ИИ-агент выполнял бизнес-задачу, ему нужны инструменты, данные, разрешения и критерии завершения. Это различие особенно важно при чтении демонстраций: красивый результат в подготовленной среде ещё нужно воспроизвести в собственном процессе.

Что показывают тесты OpenAI

OpenAI сообщает о 98% на FrontierMath Tier 4 и 100% на ExploitBench. Второй результат сравнивается с 78,5% у GPT-5.6 Sol; речь идёт о специальном тесте кибервозможностей без производственных защит, а не о доступной каждому функции.

Ближе к офисной практике сравнение OSWorld 2.0: в симуляции задержек Astra набрала 72,6% при примерно 40 минутах на задачу, Sol — 65,7% при примерно 75 минутах. Это измерение конкретного испытания, а не обещание вдвое ускорить любую работу.

В том же анонсе Cognition положительно оценивает работу Astra в Devin, а Lovable — проверку создаваемых приложений. Это отзывы ранних партнёров, опубликованные разработчиком модели; их полезно читать отдельно от независимого рейтинга. Источник результатов и отзывов — OpenAI.

Лучше ли Astra предшественников и конкурентов

Artificial Analysis провела собственное сравнение. Оно показывает неоднородный прогресс.

В первом индексе сравниваются модели в соответствующих рабочих оболочках, включая Codex и Claude Code. В проверке программирования Astra на максимальном усилии использовала примерно втрое меньше токенов, чем Sol, и показала более высокий результат при сопоставимой стоимости задания.

Однако в общем Intelligence Index сопоставимое качество сопровождалось примерно на 75% большей стоимостью задания. Исследователи также отмечают улучшение AA-Briefcase и ухудшение GDPval-AA v2. Поэтому утверждение «Astra лучше всех во всём» эти результаты не поддерживают.

Для выбора я бы сравнивал один и тот же набор рабочих заданий: правильность результата, время, число исправлений человеком и итоговую стоимость. Место в рейтинге помогает составить список кандидатов, но не заменяет такую проверку.

Почему у ARC-AGI-3 сразу два результата

ARC Prize опубликовала собственный разбор Astra. В стандартном окружении модель получила 62,7%, а с адаптером провайдера — 99,9%. Эти числа относятся к разным условиям и уровням вычислительного усилия; их нельзя смешивать в одно универсальное свойство модели.

Адаптер сохраняет внутреннее состояние рассуждения между запросами и управляет длинным контекстом. В стандартной среде модель должна сама выбирать, какую информацию переносить в видимых заметках. Получается, что проверяется не только модель, но и способ организации её работы.

ARC Prize отдельно поясняет: насыщение этого теста не является доказательством достижения общего искусственного интеллекта. На мой взгляд, практический вывод важнее громкой формулировки: память, инструменты и сохранение состояния способны существенно менять результат ИИ-агента. При внедрении эти части системы стоит оценивать вместе.

Что это означает для бизнеса

Я бы начал с одного процесса, где можно сохранить исходное задание и независимо проверить результат. Например, подготовить черновик документа по утверждённым данным, собрать отчёт или проверить работу формы. Для каждого сценария заранее нужен список того, что считается ошибкой и какие действия требуют согласования.

Такой подход описан в материале о выборе процесса для первого AI-пилота. После пробного запуска полезно отдельно провести приёмку ИИ-агента по рабочему результату, сохранив примеры успешных и неудачных заданий.

В этой статье я не выдаю опубликованные тесты за собственный эксперимент Alek IT Lab. Для конкретного внедрения основанием перехода на Astra должен стать повторяемый выигрыш на выбранном процессе. Если он проявляется только в части задач, модель можно оценивать именно для этой части, не меняя автоматически весь рабочий процесс.