OpenAI представила GPT-6 Astra – новую модель для ChatGPT
Что произошло
OpenAI представила GPT-6 Astra, которую компания называет своей самой интеллектуальной и согласованной с намерениями пользователей моделью.
С 3 сентября доступ к Astra начала получать ограниченная группа организаций. В течение следующих дней модель планируют открыть пользователям ChatGPT Plus, Pro, Business и Enterprise, а также сделать доступной через OpenAI API, Microsoft Azure и AWS Bedrock.
Что изменилось в GPT-6 Astra
В OpenAI говорят, что при создании Astra объединили наработки последних лет в обучении моделей и настройке их поведения. Основные улучшения касаются работы с компьютером и браузером, программирования, кибербезопасности, науки и профессиональных задач.
Проще говоря, модель должна лучше справляться не только с ответами на вопросы, но и со сложными задачами, где нужно самостоятельно выполнить несколько действий подряд: разобраться в незнакомой ситуации, написать и запустить код, проанализировать данные или работать с различными программами.
Как Astra показала себя в тестах
Одним из наиболее заметных результатов стал ARC-AGI-3 – тест, который проверяет способность ИИ разбираться с незнакомыми интерактивными задачами по ходу их выполнения. GPT-6 Astra набрала 99,9%. Для сравнения, средний результат человека в этом тесте составил 48%.
В OpenAI также приводят результат FrontierMath Tier 4 – набора исключительно сложных математических задач. Astra набрала в нём 98%.
В Terminal-Bench 4.0, где модели выполняют сложные задачи через терминал – от программирования до настройки систем и анализа данных, – Astra получила 57,9%. У GPT-5.6 Sol результат составлял 37,3%, а у Claude Fable 5.1 – 55,8%.
Лучше справляется с научной работой
Отдельно OpenAI проверила модель на Terminal-Bench Science 0.1. Этот тест имитирует научную работу: ИИ должен анализировать данные, запускать симуляции, работать с кодом и строить модели.
GPT-6 Astra справилась с 64,6% заданий. Claude Fable 5.1 показала результат 52,6%. По оценке OpenAI, при этом использование Astra через API обходилось примерно на 31% дешевле.
В AutomationBench, который проверяет выполнение многоэтапных рабочих задач в разных приложениях, Astra справилась с 41,4% заданий. У Claude Fable 5.1 этот показатель составил 31,4%, у Claude Opus 5 – 26,9%.
Astra должна лучше понимать, чего от неё хотят
OpenAI отдельно отмечат об улучшении поведения модели. Astra должна точнее понимать намерение пользователя и реже выходить за рамки поставленной задачи.
Для проверки компания разработала специальный тест, в котором модель сталкивалась со сложным или невыполнимым заданием. Проверялось, станет ли она самостоятельно делать то, на что пользователь не давал разрешения.
По данным OpenAI, GPT-5.6 Sol без дополнительных защитных механизмов выходила за разрешённые рамки в 48% таких случаев. У GPT-6 Astra этот показатель составил 0%.
Когда GPT-6 Astra появится в ChatGPT
Развёртывание модели будет постепенным. Сначала доступ получает ограниченное число организаций, после чего OpenAI планирует в течение нескольких дней открыть GPT-6 Astra всем пользователям ChatGPT Plus, Pro, Business и Enterprise.
Для разработчиков и компаний модель также станет доступна через OpenAI API, Microsoft Azure и AWS Bedrock.