GPT-6 Astra: где скачок настоящий, а где дело в стенде
OpenAI представила GPT-6 Astra и впервые позволяет себе говорить про наступление эры AGI. Цифры в анонсе сильные, спорить с ними не приходится.
Но два самых громких числа в этой новости требуют совершенно разного отношения. Одно получено на стенде, который отличается от стенда для остальных моделей, и в общий зачёт его брать нельзя. Второе получено честно, и оно куда интереснее первого, хотя обсуждают его меньше. Разберём оба.
Что заявлено
Цена в API составляет 10 долларов за миллион входных токенов и 50 за миллион выходных. Это ровно столько же, сколько у Claude Fable 5.1, вышедшей двумя днями раньше, так что выбирать между ними по прайсу не получится.
Отдельно есть режим ускоренной работы: до 2,5 раза быстрее при двойном тарифе. Контекст около 1,05 миллиона токенов. Сначала доступ открыли ограниченному числу организаций, в ближайшие дни обещают всем платным пользователям.
Бенчмарки
| Бенчмарк | GPT-6 Astra |
|---|---|
| Terminal-Bench 4.0 | 57,7% |
| Terminal-Bench-Science 0.1 | 64,6% |
| ARC-AGI-3, стандартный стенд | 62,7% |
| ARC-AGI-3, стенд OpenAI | от 98,6 до 99,9% |
| ExploitBench | 100% |
| GPQA Diamond | 96% |
| FrontierMath v2 Tier 4 | 97,6% |
| DeepSWE v1.1 | 74,1% |
| Agents' Last Exam | 59,3% |
Две строки в этой таблице заслуживают отдельного разговора, и начнём с той, где число выглядит внушительнее.
Почему у ARC-AGI-3 два разных числа
Чисел на самом деле три, и все они про одну и ту же модель на одном и том же тесте:
1) 99,9 процента на стенде Provider Adapter, который сохраняет состояние рассуждения модели между
запросами
2) 98,6 процента по официальному отчёту OpenAI, на стенде поверх Responses API
3) 62,7 процента на стандартном стенде, на полузакрытом наборе задач
Разница не в модели, а в обвязке вокруг неё. Astra проверяли через собственный стенд компании с двумя изменёнными настройками, а другие модели проверяли иначе. Сравнивать между собой можно только третье число, потому что только оно получено в тех же условиях, что и результаты конкурентов.
Это как рекорд, поставленный при попутном ветре. Секунды на табло настоящие, спортсмен ничего не подделывал, но в общий зачёт такой результат не идёт, и это правило придумали не из вредности.
Справедливости ради, достижение здесь есть, и немаленькое. Даже 62,7 процента на стандартном стенде, это лучший результат среди всех моделей. Просто он не 99,9, а разница между этими числами для читателя новости огромна.
Отсюда правило, которое пригодится на каждом следующем релизе: у бенчмарка есть не только число, но и стенд. Если в пересказе стенд не назван, число сравнивать не с чем.
Terminal-Bench: где Astra впереди, а где нет
В Terminal-Bench 4.0 у Astra 57,7 процента. Она действительно обходит Claude Fable 5.1 с её 55,8, но лучший результат на этом тесте не у неё: у Claude Mythos 5.1 там 60,9 процента. Правда, Mythos раздают только проверенным организациям, так что среди моделей общего доступа Astra впереди, а абсолютный максимум пока чужой.
А вот в Terminal-Bench-Science отрыв настоящий и крупный: 64,6 процента против 52,6 у ближайшего конкурента. Это тест на то, справляется ли агент с научной работой через терминал, то есть с разбором данных, запуском симуляций и подгонкой моделей. Здесь никаких оговорок про стенд нет.
ExploitBench: главная новость этого релиза
Сто процентов против 78,5 у прошлой модели OpenAI. Это тот случай, когда "практически абсолютный результат" сказано верно, и вот что за ним стоит.
ExploitBench собран летом 2026 года из двадцати уязвимостей высокой критичности в движке V8 на тринадцати стабильных выпусках Chrome. Задача агента, добиться выполнения произвольного кода. То есть тест меряет не рассуждения о безопасности, а способность довести работу до конца.
Вдобавок во время проверки модель нашла две ранее неизвестные уязвимости.
Astra стала первой моделью OpenAI, которая по внутренней методике компании достигла порога критических возможностей в кибербезопасности, и поэтому её выпустили с усиленными ограничениями.
Разговор здесь смещается из плоскости "у кого балл выше" в плоскость "что теперь с этим делать". Паниковать повода нет: инструмент получают и защищающиеся, а поиск уязвимостей в своём коде, это ровно та работа, которую хочется автоматизировать. Но порог входа для второй стороны тоже опускается, и это стоит перевести в конкретику, а не в тревогу.
Практический вывод для тех, кто отвечает за системы: посмотрите на свои сроки установки обновлений. Не на политику в документе, а на фактическое время от выхода патча до его установки в бою. Именно этот интервал становится дороже, когда работа по написанию рабочего эксплойта из известной уязвимости ускоряется.
Сколько это стоит и стоит ли
Цена совпадает с Fable 5.1 до цента, поэтому выбирать придётся по поведению на ваших задачах, а не по прайсу.
Режим ускоренной работы считайте отдельно: тариф вдвое выше, скорость до 2,5 раза выше. Такой обмен оправдан там, где задержка стоит денег напрямую, например в интерактивном интерфейсе, и не оправдан в фоновых прогонах, которым всё равно, вернётся ответ за минуту или за две с половиной.
И один трезвящий взгляд со стороны. Агрегатор benchlm по своей сводной методике ставит Astra на четвёртое место из 231 модели с оценкой 81,9 из 100, а прошлой GPT-5.6 Sol даёт 81,8 при цене 5 и 30 долларов. По его весам получается двукратное удорожание за десятую долю балла. Это одна конкретная методика взвешивания, и относиться к ней надо так же критично, как к цифрам из анонса, но она показывает, насколько сводные оценки зависят от того, что именно в них сложили.
Что с этим делать
1) дождаться независимых прогонов на одинаковых стендах. Между анонсом и первыми внешними
замерами обычно проходит несколько дней, и именно они показывают реальную картину
2) сравнивать на своих задачах. При равной цене с Fable 5.1 решение принимается только так
3) режим ускорения включать точечно, там, где вы можете назвать цену задержки в деньгах
4) если вы отвечаете за безопасность, забрать из этой новости не балл, а вопрос про сроки
установки обновлений
Вывод
Скачок в этом релизе есть, и в научных задачах через терминал он крупный. Но самое громкое число новости, 99,9 процента, получено на стенде, который отличался от стенда для конкурентов, а сравнимый результат составляет 62,7. Оба числа настоящие, значат они разное.
Правило на будущее простое: услышав рекордную цифру, спрашивайте не только "сколько", но и "на чём мерили". В этой новости один и тот же тест дал разброс в 37 пунктов только за счёт обвязки.
Авторизуйтесь, чтобы оставить комментарий.
Нет комментариев.
Тут может быть ваша реклама
Пишите info@aisferaic.ru