Grok 4.7: что важно знать о новой модели SpaceXAI для разработки
SpaceXAI выпустила Grok 4.7: 46,3% на CursorBench 4.0, 71% на DeepSWE v1.1 и цена на уровне Grok 4.6. Разбираем бенчмарки по-человечески, доступ и практическую пользу.
SpaceXAI представила Grok 4.7 - флагманскую модель для кодинга, агентных задач и работы со знаниями. Релиз вышел 21 сентября 2026 года, примерно на месяц позже первоначального срока, а цена осталась на уровне предыдущей версии: $2 за миллион входных и $6 за миллион выходных токенов (Habr).
Новость важна не скоростью ответов в чате. Модель делает ставку на длительную автономную работу: выполняет цепочки действий, проверяет собственные результаты и удерживает в памяти большой объём текста. Компания описывает её как фронтирную модель для кодинга, агентных задач и работы со знаниями (разбор AI Intel Report).
Два термина, без которых дальше не разобраться. Агентные задачи - это когда модель не просто отвечает на один вопрос, а последовательно выполняет несколько шагов: читает файлы, запускает команды, проверяет результат, исправляет ошибки. Контекстное окно - сколько текста модель держит «в голове» одновременно. У Grok 4.7 оно составляет 500 000 токенов (обзор модели с параметрами доступа). Токен - часть слова, примерно 3-4 символа; 500 000 токенов это ориентировочно 300-400 страниц текста. На вход модель принимает текст и изображения, на выходе выдаёт текст.
Чем Grok 4.7 отличается от Grok 4.6
Изменения касаются трёх направлений.
- Агентный кодинг. Модель прошла расширенное обучение с подкреплением на многочасовых задачах. Обучение с подкреплением - метод, при котором удачные решения модели закрепляются, а неудачные отбрасываются.
- Самопроверка. Grok 4.7 перечитывает собственные результаты и находит в них ошибки или несоответствия прямо по ходу задачи.
- Работа с инструментами. Модель активнее вызывает внешние функции и источники данных, когда решает задачу.
Эти три пункта описывает технический обзор релиза (AI Intel Report). По собственным тестам SpaceXAI рост виден в цифрах: на CursorBench 4.0 результат вырос с 40,4% до 46,3%, на Terminal-Bench 4.0 - с 20,3% до 38%. Цена при этом не изменилась.
Вывод простой: это не революция, а заметный шаг вперёд. Сильнее всего разница ощущается там, где модели нужно действовать самостоятельно долгое время, а не выдавать один короткий ответ.
Бенчмарки Grok 4.7: где модель сильна, а где уступает
Бенчмарк - стандартизированный тест для сравнения моделей: один и тот же набор задач прогоняют через разные модели и смотрят, кто набрал больше. Часть результатов Grok 4.7 SpaceXAI приводит в собственном анонсе, и это стоит держать в голове: компания тестирует свою модель сама (Habr).
CursorBench 4.0: практическое программирование
CursorBench 4.0 проверяет практические задачи программирования в среде Cursor - редакторе кода с ИИ-ассистентом. Grok 4.7 набрала 46,3% против 40,4% у Grok 4.6 и 41,7% у GPT-5.6 Sol. Разрыв с ближайшим конкурентом почти 5 процентных пунктов, и это тест, где новая модель обошла и предшественницу, и соперника от OpenAI. Как выглядело противостояние предыдущего поколения Grok с GPT-5.6 Sol, мы разбирали в отдельном сравнении (Grok 4.6 против GPT-5.6 Sol).
Terminal-Bench 4.0: работа в командной строке
Terminal-Bench 4.0 проверяет работу в командной строке: выполнение команд, управление файлами, задачи системного администрирования. Результат Grok 4.7 вырос с 20,3% до 38%, почти вдвое. Для агентных сценариев это ключевой показатель: именно в терминале модель чаще всего действует автономно, и рост здесь означает меньше ручных подсказок со стороны человека.
DeepSWE v1.1 и Artificial Analysis: где Grok 4.7 уступает
DeepSWE v1.1 проверяет реальные задачи разработки. Grok 4.7 показала 71%, немного уступив GPT-5.6 Sol (72,7%), но обойдя Fable 5.1 (70%). Кодинг-тесты модель проходит достойно, однако абсолютным лидером не становится.
В независимом рейтинге Artificial Analysis Intelligence Index картина скромнее: Grok 4.7 получила 46 баллов и осталась позади Claude Fable 5.1 Max, Claude Fable 5, Claude Opus 5, GPT-6 Astra, GPT-5.6 Sol (Max) и Meta Muse Spark 1.3 Max. На бенчмарке по электротехнике EEBench модель достигла 64%. В отдельных специализированных тестах, например Terminal-Bench 4.0, она уступила открытой DeepSeek V4.1 Flash (сводка результатов).
Отдельный нюанс касается расхода токенов. По данным Artificial Analysis, Grok 4.7 тратит в среднем 81 тысячу выходных токенов на задачу, тогда как Grok 4.6 - около 36 тысяч, а GPT-6 Astra - 27 тысяч (тот же обзор). Модель «думает» дольше и подробнее. Для длинных задач это плюс, но выходные токены стоят $6 за миллион, поэтому счёт за использование может вырасти даже при неизменном прайсе.
Сколько стоит Grok 4.7 и как её попробовать
Прайс не изменился относительно Grok 4.6: $2 за миллион входных и $6 за миллион выходных токенов. Многие ждали подорожания, но SpaceXAI сохранила цены. Похожую стратегию компания применяла и в прошлом поколении, сделав ставку на доступность против лидеров рынка (Grok 4.6 как доступная альтернатива).
Цена и Fast-версия: что выбрать
Помимо стандартного варианта есть Fast-версия. Она работает вдвое быстрее, но стоит вдвое дороже. Ориентир для выбора простой: скорость оправдывает переплату в интерактивных сценариях, где человек ждёт ответа прямо сейчас, например при живом редактировании кода, в чате с пользователем или в подсказках в реальном времени. Для фоновых задач, пакетной обработки и длинных автономных прогонов выгоднее стандартная версия: разница в скорости там незаметна, а счёт вырастает ощутимо.
Где получить доступ: Cursor, Grok Build, API
Grok 4.7 доступна в Cursor, через API, в Grok Build, в сторонних кодинг-агентах и облачных платформах. В Grok Build на старте можно попробовать бесплатно (обзор релиза под кодинг). Доступ через API и варианты интеграции собраны в карточке модели (описание API-доступа).
Если вы уже работаете с Grok 4.6 через API, переход не требует переписывать код: достаточно сменить название модели в запросе. Пользователям Cursor менять ничего не нужно, модель появляется прямо в интерфейсе.
Безопасность: что показал HackerBench v0.3
SpaceXAI заявляет о новом наборе защитных механизмов. На тесте HackerBench v0.3 модель пропустила 3,3% потенциально опасных запросов. При этом, по заявлению компании, она редко отказывала в легитимных задачах по информационной безопасности (Habr).
Что такое HackerBench и почему это важно
HackerBench проверяет две вещи одновременно: пропускает ли модель запросы, которые могут навредить, и отказывает ли она там, где задача законна. Это баланс между безопасностью и полезностью. Слишком строгие фильтры мешают специалистам по информационной безопасности: модель отказывается объяснять уязвимости или разбирать чужой код. Слишком слабые создают риск.
3,3% пропущенных опасных запросов - низкий показатель, но не ноль. Из примерно 30 опасных запросов один может пройти. Данные приводятся со слов SpaceXAI, независимого подтверждения пока нет, поэтому оценивать их стоит как заявку компании, а не как подтверждённый факт.
Что это значит для вас, даже если вы не программист
Сфера применения Grok 4.7 шире программирования. Формулировка «работа со знаниями» охватывает задачи с документами, данными и текстами. Контекстное окно 500 000 токенов позволяет загрузить объём, сопоставимый с несколькими сотнями страниц, и задавать вопросы по всему массиву сразу, без разбивки на части.
Механизмы самопроверки меняют и поведение модели в цепочке задач: она перечитывает собственные выводы и исправляет их по ходу. Для не-разработчика это означает, что делегировать можно не одно действие, а последовательность, например подготовку сводки из набора отчётов.
Практические сценарии для не-разработчиков
- Разбор больших документов. Загрузить комплект договоров или отчётов и получить сравнение условий, а не отдельные цитаты.
- Аналитика на основе данных. Свести информацию из нескольких источников в один вывод и проверить логику расчётов.
- Подготовка решений. Собрать аргументы за и против варианта, опираясь на документы, которые вы дали модели.
Руководителям это даёт сигнал: ИИ-инструменты годятся теперь для делегирования многошаговых задач, а не одних коротких поручений. Проверку человеком никто не отменяет, особенно в критичных решениях: 3,3% пропущенных опасных запросов на HackerBench показывают, что фильтры не абсолютны, и в чувствительных сценариях финальное слово остаётся за специалистом.
Контекст: задержка релиза и что дальше
Релиз вышел 21 сентября 2026 года, примерно на месяц позже первоначального срока. Задержка не говорит о проблемах с качеством: по заявленным тестам модель заметно обошла Grok 4.6. Обещания по следующим версиям озвучил Илон Маск: более значительный скачок ожидается в Grok 4.8 и 4.9, а версия 4.9, по его словам, приблизится к конкурентам класса Fable (обзор релиза).
Стоит ли ждать Grok 4.8 и 4.9
Конкретных сроков выхода Grok 4.8 и 4.9 нет, а заявления о будущих версиях остаются обещаниями, а не подтверждёнными фактами. Отсюда практический вывод. Если модель нужна сейчас, Grok 4.7 уже доступна и показывает измеримый рост относительно Grok 4.6. Если вы можете подождать, есть смысл следить за анонсами, но планировать работу под версии без даты релиза рискованно. Учитывайте и задержку текущего релиза: прошлый срок сдвинулся на месяц, следующий может сдвинуться так же.
Коротко: главное о Grok 4.7
- Grok 4.7 - флагманская модель SpaceXAI для кодинга, агентных задач и работы со знаниями. Релиз вышел 21 сентября 2026 года.
- Контекстное окно - 500 000 токенов, на вход модель принимает текст и изображения.
- CursorBench 4.0: 46,3% против 40,4% у Grok 4.6 и 41,7% у GPT-5.6 Sol.
- Terminal-Bench 4.0: рост с 20,3% до 38%. DeepSWE v1.1: 71%, чуть ниже GPT-5.6 Sol (72,7%).
- Artificial Analysis Intelligence Index: 46 баллов, позади нескольких конкурентов. Расход выходных токенов вырос до 81 тысячи на задачу.
- Цена не изменилась: $2 за миллион входных и $6 за миллион выходных токенов. Fast-версия вдвое быстрее и вдвое дороже.
- Доступна в Cursor, Grok Build, через API, в сторонних кодинг-агентах и облачных платформах.
- HackerBench v0.3: 3,3% пропущенных опасных запросов. Данные SpaceXAI, независимого подтверждения нет.
- Маск обещает более значительный скачок в Grok 4.8 и 4.9, сроки не названы.
Есть вопрос или заметили неточность? Напишите нам: мы обновляем разбор, когда появляются новые данные и независимые проверки.