Grok 4.7: что важно знать о новой модели SpaceXAI для разработки

Grok 4.7: что важно знать о новой модели SpaceXAI для разработки

SpaceXAI выпустила Grok 4.7: 46,3% на CursorBench 4.0, 71% на DeepSWE v1.1 и цена на уровне Grok 4.6. Разбираем бенчмарки по-человечески, доступ и практическую пользу.

SpaceXAI представила Grok 4.7 - флагманскую модель для кодинга, агентных задач и работы со знаниями. Релиз вышел 21 сентября 2026 года, примерно на месяц позже первоначального срока, а цена осталась на уровне предыдущей версии: $2 за миллион входных и $6 за миллион выходных токенов (Habr).

Новость важна не скоростью ответов в чате. Модель делает ставку на длительную автономную работу: выполняет цепочки действий, проверяет собственные результаты и удерживает в памяти большой объём текста. Компания описывает её как фронтирную модель для кодинга, агентных задач и работы со знаниями (разбор AI Intel Report).

Два термина, без которых дальше не разобраться. Агентные задачи - это когда модель не просто отвечает на один вопрос, а последовательно выполняет несколько шагов: читает файлы, запускает команды, проверяет результат, исправляет ошибки. Контекстное окно - сколько текста модель держит «в голове» одновременно. У Grok 4.7 оно составляет 500 000 токенов (обзор модели с параметрами доступа). Токен - часть слова, примерно 3-4 символа; 500 000 токенов это ориентировочно 300-400 страниц текста. На вход модель принимает текст и изображения, на выходе выдаёт текст.

Чем Grok 4.7 отличается от Grok 4.6

Изменения касаются трёх направлений.

  • Агентный кодинг. Модель прошла расширенное обучение с подкреплением на многочасовых задачах. Обучение с подкреплением - метод, при котором удачные решения модели закрепляются, а неудачные отбрасываются.
  • Самопроверка. Grok 4.7 перечитывает собственные результаты и находит в них ошибки или несоответствия прямо по ходу задачи.
  • Работа с инструментами. Модель активнее вызывает внешние функции и источники данных, когда решает задачу.

Эти три пункта описывает технический обзор релиза (AI Intel Report). По собственным тестам SpaceXAI рост виден в цифрах: на CursorBench 4.0 результат вырос с 40,4% до 46,3%, на Terminal-Bench 4.0 - с 20,3% до 38%. Цена при этом не изменилась.

Вывод простой: это не революция, а заметный шаг вперёд. Сильнее всего разница ощущается там, где модели нужно действовать самостоятельно долгое время, а не выдавать один короткий ответ.

Бенчмарки Grok 4.7: где модель сильна, а где уступает

Бенчмарк - стандартизированный тест для сравнения моделей: один и тот же набор задач прогоняют через разные модели и смотрят, кто набрал больше. Часть результатов Grok 4.7 SpaceXAI приводит в собственном анонсе, и это стоит держать в голове: компания тестирует свою модель сама (Habr).

CursorBench 4.0: практическое программирование

CursorBench 4.0 проверяет практические задачи программирования в среде Cursor - редакторе кода с ИИ-ассистентом. Grok 4.7 набрала 46,3% против 40,4% у Grok 4.6 и 41,7% у GPT-5.6 Sol. Разрыв с ближайшим конкурентом почти 5 процентных пунктов, и это тест, где новая модель обошла и предшественницу, и соперника от OpenAI. Как выглядело противостояние предыдущего поколения Grok с GPT-5.6 Sol, мы разбирали в отдельном сравнении (Grok 4.6 против GPT-5.6 Sol).

Terminal-Bench 4.0: работа в командной строке

Terminal-Bench 4.0 проверяет работу в командной строке: выполнение команд, управление файлами, задачи системного администрирования. Результат Grok 4.7 вырос с 20,3% до 38%, почти вдвое. Для агентных сценариев это ключевой показатель: именно в терминале модель чаще всего действует автономно, и рост здесь означает меньше ручных подсказок со стороны человека.

DeepSWE v1.1 и Artificial Analysis: где Grok 4.7 уступает

DeepSWE v1.1 проверяет реальные задачи разработки. Grok 4.7 показала 71%, немного уступив GPT-5.6 Sol (72,7%), но обойдя Fable 5.1 (70%). Кодинг-тесты модель проходит достойно, однако абсолютным лидером не становится.

В независимом рейтинге Artificial Analysis Intelligence Index картина скромнее: Grok 4.7 получила 46 баллов и осталась позади Claude Fable 5.1 Max, Claude Fable 5, Claude Opus 5, GPT-6 Astra, GPT-5.6 Sol (Max) и Meta Muse Spark 1.3 Max. На бенчмарке по электротехнике EEBench модель достигла 64%. В отдельных специализированных тестах, например Terminal-Bench 4.0, она уступила открытой DeepSeek V4.1 Flash (сводка результатов).

Отдельный нюанс касается расхода токенов. По данным Artificial Analysis, Grok 4.7 тратит в среднем 81 тысячу выходных токенов на задачу, тогда как Grok 4.6 - около 36 тысяч, а GPT-6 Astra - 27 тысяч (тот же обзор). Модель «думает» дольше и подробнее. Для длинных задач это плюс, но выходные токены стоят $6 за миллион, поэтому счёт за использование может вырасти даже при неизменном прайсе.

Сколько стоит Grok 4.7 и как её попробовать

Прайс не изменился относительно Grok 4.6: $2 за миллион входных и $6 за миллион выходных токенов. Многие ждали подорожания, но SpaceXAI сохранила цены. Похожую стратегию компания применяла и в прошлом поколении, сделав ставку на доступность против лидеров рынка (Grok 4.6 как доступная альтернатива).

Цена и Fast-версия: что выбрать

Помимо стандартного варианта есть Fast-версия. Она работает вдвое быстрее, но стоит вдвое дороже. Ориентир для выбора простой: скорость оправдывает переплату в интерактивных сценариях, где человек ждёт ответа прямо сейчас, например при живом редактировании кода, в чате с пользователем или в подсказках в реальном времени. Для фоновых задач, пакетной обработки и длинных автономных прогонов выгоднее стандартная версия: разница в скорости там незаметна, а счёт вырастает ощутимо.

Где получить доступ: Cursor, Grok Build, API

Grok 4.7 доступна в Cursor, через API, в Grok Build, в сторонних кодинг-агентах и облачных платформах. В Grok Build на старте можно попробовать бесплатно (обзор релиза под кодинг). Доступ через API и варианты интеграции собраны в карточке модели (описание API-доступа).

Если вы уже работаете с Grok 4.6 через API, переход не требует переписывать код: достаточно сменить название модели в запросе. Пользователям Cursor менять ничего не нужно, модель появляется прямо в интерфейсе.

Безопасность: что показал HackerBench v0.3

SpaceXAI заявляет о новом наборе защитных механизмов. На тесте HackerBench v0.3 модель пропустила 3,3% потенциально опасных запросов. При этом, по заявлению компании, она редко отказывала в легитимных задачах по информационной безопасности (Habr).

Что такое HackerBench и почему это важно

HackerBench проверяет две вещи одновременно: пропускает ли модель запросы, которые могут навредить, и отказывает ли она там, где задача законна. Это баланс между безопасностью и полезностью. Слишком строгие фильтры мешают специалистам по информационной безопасности: модель отказывается объяснять уязвимости или разбирать чужой код. Слишком слабые создают риск.

3,3% пропущенных опасных запросов - низкий показатель, но не ноль. Из примерно 30 опасных запросов один может пройти. Данные приводятся со слов SpaceXAI, независимого подтверждения пока нет, поэтому оценивать их стоит как заявку компании, а не как подтверждённый факт.

Что это значит для вас, даже если вы не программист

Сфера применения Grok 4.7 шире программирования. Формулировка «работа со знаниями» охватывает задачи с документами, данными и текстами. Контекстное окно 500 000 токенов позволяет загрузить объём, сопоставимый с несколькими сотнями страниц, и задавать вопросы по всему массиву сразу, без разбивки на части.

Механизмы самопроверки меняют и поведение модели в цепочке задач: она перечитывает собственные выводы и исправляет их по ходу. Для не-разработчика это означает, что делегировать можно не одно действие, а последовательность, например подготовку сводки из набора отчётов.

Практические сценарии для не-разработчиков

  • Разбор больших документов. Загрузить комплект договоров или отчётов и получить сравнение условий, а не отдельные цитаты.
  • Аналитика на основе данных. Свести информацию из нескольких источников в один вывод и проверить логику расчётов.
  • Подготовка решений. Собрать аргументы за и против варианта, опираясь на документы, которые вы дали модели.

Руководителям это даёт сигнал: ИИ-инструменты годятся теперь для делегирования многошаговых задач, а не одних коротких поручений. Проверку человеком никто не отменяет, особенно в критичных решениях: 3,3% пропущенных опасных запросов на HackerBench показывают, что фильтры не абсолютны, и в чувствительных сценариях финальное слово остаётся за специалистом.

Контекст: задержка релиза и что дальше

Релиз вышел 21 сентября 2026 года, примерно на месяц позже первоначального срока. Задержка не говорит о проблемах с качеством: по заявленным тестам модель заметно обошла Grok 4.6. Обещания по следующим версиям озвучил Илон Маск: более значительный скачок ожидается в Grok 4.8 и 4.9, а версия 4.9, по его словам, приблизится к конкурентам класса Fable (обзор релиза).

Стоит ли ждать Grok 4.8 и 4.9

Конкретных сроков выхода Grok 4.8 и 4.9 нет, а заявления о будущих версиях остаются обещаниями, а не подтверждёнными фактами. Отсюда практический вывод. Если модель нужна сейчас, Grok 4.7 уже доступна и показывает измеримый рост относительно Grok 4.6. Если вы можете подождать, есть смысл следить за анонсами, но планировать работу под версии без даты релиза рискованно. Учитывайте и задержку текущего релиза: прошлый срок сдвинулся на месяц, следующий может сдвинуться так же.

Коротко: главное о Grok 4.7

  • Grok 4.7 - флагманская модель SpaceXAI для кодинга, агентных задач и работы со знаниями. Релиз вышел 21 сентября 2026 года.
  • Контекстное окно - 500 000 токенов, на вход модель принимает текст и изображения.
  • CursorBench 4.0: 46,3% против 40,4% у Grok 4.6 и 41,7% у GPT-5.6 Sol.
  • Terminal-Bench 4.0: рост с 20,3% до 38%. DeepSWE v1.1: 71%, чуть ниже GPT-5.6 Sol (72,7%).
  • Artificial Analysis Intelligence Index: 46 баллов, позади нескольких конкурентов. Расход выходных токенов вырос до 81 тысячи на задачу.
  • Цена не изменилась: $2 за миллион входных и $6 за миллион выходных токенов. Fast-версия вдвое быстрее и вдвое дороже.
  • Доступна в Cursor, Grok Build, через API, в сторонних кодинг-агентах и облачных платформах.
  • HackerBench v0.3: 3,3% пропущенных опасных запросов. Данные SpaceXAI, независимого подтверждения нет.
  • Маск обещает более значительный скачок в Grok 4.8 и 4.9, сроки не названы.

Есть вопрос или заметили неточность? Напишите нам: мы обновляем разбор, когда появляются новые данные и независимые проверки.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции