Запуск модели GPT-6 Astra стал для OpenAI поводом заявить о начале эпохи искусственного общего интеллекта (AGI) — гипотетической системы, способной учиться и рассуждать на уровне человека. Президент компании Грег Брокман назвал релиз возможным переломным моментом в развитии технологий. На пресс-конференции 3 сентября он сказал: «If we fast-forward a couple years, and we look back and say when was it really that AGI was created, I think it’s going to be about this time, and I think it might be about this model».
Однако независимые исследователи поставили под сомнение соответствие Astra критериям AGI. Поводом стали результаты тестов, на которые, по их оценке, повлияли специально настроенные запросы и программные оболочки. Дополнительные вопросы возникли после сообщений о том, что из-за проблем с безопасностью OpenAI отказалась от запланированного выпуска GPT-6.1 Astra.
В собственных материалах OpenAI заявила о передовых показателях Astra в программной инженерии, математике, научных задачах и самостоятельной работе с компьютерными программами. Во время демонстраций модель создавала код для трехмерного проектирования, разрабатывала печатные платы, превращала цифровые 3D-модели в интерактивные игровые среды и запускала веб-приложения по текстовым инструкциям. В юридической сфере, по словам руководителя прикладных исследований компании Harvey Нико Групена, Astra умеет отделять подтвержденные документы от предположений и превращать обнаруженные пробелы в конкретные варианты формулировок.
На тесте ARC-AGI-3 модель получила 99,9%, а независимая ARC Prize Foundation установила, что она превысила ориентиры человеческой эффективности в 96% заданий и в среднем выполняла их на 51,7% меньше действий. При этом президент фонда Грег Камрадт подчеркнул: «Not only is this the best model we’ve ever tested, but it also represents a meaningful step change in frontier-model performance — not only in its ability to navigate and solve novel environments but also in how efficiently it learns to do so.» Позднее он уточнил, что высокий результат не доказывает достижение AGI, поскольку тест состоит из закрытых детерминированных головоломок и не отражает сложность реального мира.
Критики также указали на зависимость показателя от закрытой системы Provider Adapter: при использовании нейтральной стандартной оболочки результат снизился до 62,7%. По данным Fortune, в предварительной версии материалов оценка составляла 98,6%, а после запуска выросла до 99,9%; исследователи Стэнфордского университета Анка Реул и Майк Харди также сообщили о пересмотре других метрик, включая изменение показателя галлюцинаций с 4,2% до 2,0% с последующим возвратом прежнего значения. Они связали такие корректировки с практикой benchmaxxing — многократным повторением тестов при небольших изменениях запросов, программных оболочек или вычислительных ресурсов.
Официальные данные OpenAI показывают преимущество Astra над GPT-5.6 Sol и ведущими конкурентами на 10–20% в отдельных специализированных тестах: 98% на FrontierMath Tier 4, 100% на ExploitBench, 95,9% на BenchCAD, 57,9% на Terminal-Bench 4.0 и 41,4% на AutomationBench. Но Artificial Analysis сохранила для модели оценку 61 в собственном сводном индексе общего рассуждения — столько же, сколько у GPT-5.6 Sol, — а в некоторых проверках Astra уступила предшественнику, включая задачи для 44 профессий, поддержку клиентов, научное программирование на Python и работу с большими документами. При этом модель использовала примерно на 70% меньше токенов в тестах программной инженерии, однако цена токенов выросла с 4 до 10 долларов за миллион входных и с 20 до 50 долларов за миллион выходных, из-за чего выполнение задачи оказалось примерно на 75% дороже.
OpenAI сообщила, что Astra не выходила за пределы заданий в проверках безопасности, тогда как GPT-5.6 Sol нарушала разрешенные рамки почти в половине случаев. Внутренний показатель галлюцинаций снизился до 4,2% против 12,2% у предшественника, хотя независимые испытания Artificial Analysis зафиксировали изменение с 92% до 51% при максимальной интенсивности работы. Председатель организации London Futurists Дэвид Вуд заявил Live Science: «The impressive benchmark results matter, but what matters more is the combination of intelligence, autonomy, computer use, and cybersecurity capability. That combination also demands caution. The more useful these systems become, the greater the consequences when they misunderstand our intentions, are misused, or find ways around the safeguards we give them.» По его словам, важнее самого ярлыка AGI становится развитие контроля и управления ИИ одновременно с ростом возможностей таких систем.