Grok 4.7: бенчмарки, цена и что изменилось против Grok 4.6
Grok 4.7 вышел 21 сентября 2026, и главный прирост у модели на Terminal-Bench 4.0: 38,0% против 20,3% у Grok 4.6, причём эти два замера сняты на разных уровнях усилия рассуждения. На CursorBench 4.0 Grok 4.7 показал 46,3% против 41,7% у GPT-5.6 Sol. Цена осталась прежней, $2 за миллион входных токенов и $6 за миллион выходных, как у Grok 4.6.
Что показал Grok 4.7 на бенчмарках
Таблица из анонса, четыре колонки: Grok 4.7, Grok 4.6, GPT-5.6 Sol, Claude Fable 5.1.
1) CursorBench 4.0: 46,3% / 40,4% / 41,7% / 51,8%
2) Terminal-Bench 4.0: 38,0% / 20,3% / 37,3% / 57,9%
3) DeepSWE v1.1: 71,0% / 65,2% / 72,7% / 70,0%
4) EEBench: 64,0% / 53,0% / 39,4% / 56,4%
5) HealthBench Professional: 56,7% / 48,5% / 60,5% / 62,1%
6) Harvey Legal Agent Benchmark: 19,6% / 15,8% / 2,5% / 6,7%
7) AA Briefcase v1.1 (баллы, не проценты): 1657 / 1546 / 1487 / 1678
Сводка LLM Stats добавляет к этому SWE-Marathon v1.1 из карточки модели: 46,0% у Grok 4.7 против 31,9% у Grok 4.6. По EEBench материалы xAI расходятся между собой, карточка показывает 66,0%, таблица анонса 64,0% (сводка LLM Stats).
Обошёл ли Grok 4.7 GPT-5.6 Sol и Fable 5.1
Grok 4.7 выигрывает у GPT-5.6 Sol на пяти замерах из семи: CursorBench (46,3% против 41,7%), EEBench (64,0% против 39,4%), Harvey Legal (19,6% против 2,5%), AA Briefcase (1657 против 1487 баллов) и Terminal-Bench (38,0% против 37,3%). Разрыв на Terminal-Bench составляет 0,7 пункта, то есть модели там идут вровень. GPT-5.6 Sol остаётся выше на DeepSWE (72,7% против 71,0%) и HealthBench Professional (60,5% против 56,7%).
Claude Fable 5.1 держит первое место на CursorBench (51,8%), Terminal-Bench (57,9%), HealthBench (62,1%) и AA Briefcase (1678 баллов). Разрыв на Terminal-Bench самый крупный, 19,9 пункта. При этом Grok 4.7 опережает Fable 5.1 на EEBench (64,0% против 56,4%), Harvey Legal (19,6% против 6,7%) и DeepSWE (71,0% против 70,0%).
У GPT-5.6 Sol модель Grok 4.7 выигрывает пять замеров из семи, у Fable 5.1 три. Самое крупное отставание остаётся на работе с терминалом.
Сколько стоит Grok 4.7
Цена при промпте до 200 тысяч токенов, по сводке LLM Stats: $2 за миллион входных токенов, $0,50 за миллион кешированных входных и $6 за миллион выходных. Это те же числа, что у Grok 4.6. Быстрый вариант работает с двойной скоростью выдачи за двойную цену выходных токенов.
Контекстное окно модели, 500 тысяч токенов. При промпте свыше 200 тысяч токенов тарифы удваиваются, до $4 за входные и $12 за выходные (сводка LLM Stats).
Claude Fable 5.1 стоит $10 за миллион входных токенов и $50 за миллион выходных при окне в 1 миллион токенов. По обычному входу Grok 4.7 дешевле в 5 раз, по выходу в 8,3 раза.
Что эта цена означает на практике
Рабочий агент этого блога расходует около 24 тысяч токенов контекста на каждом шаге (замер от 12.09.2026). Сессия из 50 шагов с выдачей около 60 тысяч токенов даёт 1,2 миллиона входных и 60 тысяч выходных токенов. В ценах Grok 4.7 без кеширования это $2,76 за сессию, в ценах Fable 5.1 те же токены обходятся в $15,00.
На кешированном входе картина переворачивается. Grok 4.7 берёт $0,50 за миллион прочитанных из кеша токенов, Claude Fable 5.1 берёт $0,25 за миллион. Агентная нагрузка состоит из повторно читаемого контекста в основном, поэтому на длинных сессиях с горячим кешем пятикратное преимущество Grok 4.7 по входу исчезает, и по этой статье расходов он дороже вдвое.
Разрыв в 19,9 пункта на Terminal-Bench 4.0 остаётся второй частью цены. Счёт за работу считается по стоимости доведённой до конца задачи, поэтому ставку за миллион токенов имеет смысл смотреть вместе с долей задач, которые модель закрывает с первого прохода.
Насколько надёжны эти цифры
Рост с 20,3% до 38,0% замерен на разных уровнях усилия рассуждения: Grok 4.7 гоняли на уровне xhigh, Grok 4.6 на уровне high. То же касается CursorBench. Часть прироста в этих двух строках приходится на более глубокое рассуждение, доступное и предыдущей модели.
Terminal-Bench 4.0 и SWE-Marathon v1.1 замерены в обвязке Grok Build, то есть в собственной агентной оболочке. Обвязка влияет на результат сильно, и сравнение с числами других разработчиков на этих двух строках идёт с поправкой на неё.
Все числа в анонсе заявлены самой компанией. Независимой проверки на день выхода нет, LLM Stats это прямо отмечает в своей сводке.
Где уже доступна модель
Модель доступна в Cursor и Grok Build, а также через API, сторонние агентные обвязки, роутеры моделей и облачные платформы.
Коротко
Когда вышел Grok 4.7? 21 сентября 2026, анонс на сайте.
Что выросло сильнее всего? Terminal-Bench 4.0, с 20,3% у Grok 4.6 до 38,0%. Замер шёл на разных уровнях усилия рассуждения и в собственной обвязке xAI.
Обошёл ли Grok 4.7 GPT-5.6 Sol? На пяти замерах из семи обошёл, включая CursorBench, EEBench и Harvey Legal. На DeepSWE и HealthBench Professional уступил, на Terminal-Bench результаты почти равны (38,0% против 37,3%).
Сколько стоит Grok 4.7? $2 за миллион входных токенов, $0,50 за кешированные входные и $6 за миллион выходных при промпте до 200 тысяч токенов. Цена совпадает с Grok 4.6.
Какое у модели контекстное окно? 500 тысяч токенов.
Разборы других моделей и новостей ИИ лежат в блоге платформы, а чат с моделями, генерация изображений и обложек работают на aisferaic.ru.
Подняли результаты по семи замерам, оставив цену на уровне Grok 4.6. Выбор между Grok 4.7 и моделью верхнего яруса решается типом задачи и тем, насколько горяч кеш, а терминальные сценарии пока остаются слабым местом Grok.
Авторизуйтесь, чтобы оставить комментарий.
Нет комментариев.
Тут может быть ваша реклама
Пишите info@aisferaic.ru