Cerebras ускоряет GPT-5.6 Sol: как работает режим Ultrafast и почему скорость не снижает качество
OpenAI и Cerebras представили режим Ultrafast для GPT-5.6 Sol: до 750 токенов в секунду, в 14 раз быстрее, без снижения качества. Разбираем, как это работает и что это значит для пользователей.
OpenAI и Cerebras запустили режим Ultrafast для GPT-5.6 Sol. Модель генерирует до 750 токенов в секунду, что до 14 раз быстрее стандартной обработки. Это полная версия Sol, а не облегчённая копия, и работает она на специализированных чипах Cerebras. Качество ответов остаётся прежним, но стоимость и доступность пока ограничены.
Режим уже прошёл проверку на бенчмарке Humanity's Last Exam. Sol Ultrafast завершила прогон за 11 часов, тогда как у конкурента ушло 78 часов, при сопоставимой точности. Разбираем, за счёт чего достигается такая скорость и что это значит для пользователей.
Что такое режим Ultrafast и почему это важно
Ultrafast - это режим ускоренной генерации для флагманской модели GPT-5.6 Sol. Стандартная обработка запроса занимает заметное время, особенно в длинных диалогах или при работе с большими документами. Ultrafast сокращает эту задержку до уровня, близкого к мгновенному отклику.
Ключевое отличие от похожих решений: ускорение достигается за счёт аппаратной платформы Cerebras, а не за счёт упрощения модели. Пользователь получает ответы той же глубины и точности, что и в обычном режиме, но значительно быстрее. Для бизнеса это означает меньше времени ожидания в клиентской поддержке, быстрее анализ данных и более отзывчивые AI-приложения.
OpenAI позиционирует режим как шаг к более эффективному использованию вычислений. Вместо того чтобы ждать секунды, пользователи могут получать результат практически сразу, что меняет восприятие AI-сервисов в повседневной работе.
Как работает ускорение: техническая основа
Секрет скорости - в архитектуре чипов Cerebras Wafer-Scale Engine. Это процессор размером с кремниевую пластину, на которой размещено 44 ГБ памяти SRAM. Вся модель GPT-5.6 Sol помещается прямо на чипе, и веса не нужно подгружать из внешней памяти при каждом запросе.
Представьте, что все нужные книги лежат на вашем столе, а не в библиотеке на другом конце города. Вам не нужно каждый раз вставать и идти за ними. Так и здесь: данные обрабатываются внутри чипа, без долгих переходов к внешним накопителям.
Почему традиционные GPU медленнее
В обычных графических процессорах веса модели хранятся во внешней памяти HBM. При генерации каждого токена системе приходится перемещать данные между памятью и вычислительными ядрами. Это создаёт узкое место: скорость упирается в пропускную способность памяти, а не в вычислительную мощность.
Cerebras решает проблему иначе. Память SRAM встроена непосредственно в процессор, и доступ к ней происходит гораздо быстрее. Модель не ждёт, пока данные подтянутся из внешнего хранилища, поэтому генерация идёт непрерывно.
Роль SRAM и распределения слоёв
SRAM - это очень быстрая память, встроенная в процессор. В отличие от DRAM, которая используется в обычных компьютерах, SRAM не требует постоянного обновления данных и обеспечивает минимальные задержки доступа. 44 ГБ такой памяти достаточно, чтобы разместить все веса GPT-5.6 Sol.
Слои модели распределены по разным участкам пластины. Данные проходят через них последовательно, но без задержек на передачу между чипами. Это позволяет обрабатывать запросы параллельно и избегать простоев, характерных для кластеров GPU.
Почему скорость не снижает качество
Главный вопрос, который возникает при любом ускорении: не пострадало ли качество? В случае с Ultrafast ответ - нет. OpenAI и Cerebras запускают полную версию GPT-5.6 Sol, без дистилляции и урезания параметров. Ускорение достигается исключительно за счёт аппаратной оптимизации.
Модель выполняет те же вычисления, что и в стандартном режиме. Меняется только способ доступа к данным и их перемещения внутри системы. Поэтому ответы сохраняют ту же глубину рассуждений и точность, что и при обычной работе.
Результаты теста Humanity's Last Exam
Humanity's Last Exam - это сложный бенчмарк, созданный для оценки способностей AI-моделей на пределе их возможностей. Он включает вопросы, требующие глубокого понимания и многошаговых рассуждений.
Sol Ultrafast завершила прогон теста за 11 часов. Конкурент потратил на тот же объём работы 78 часов. Точность при этом оказалась сопоставимой. Это прямое доказательство: скорость не покупается ценой качества.
Для пользователя это означает, что быстрые ответы в чате не становятся поверхностными. Можно получать развёрнутые, обоснованные выводы без длительного ожидания.
Ограничения и текущая доступность
Режим Ultrafast пока доступен ограниченной группе клиентов. OpenAI не раскрывает стоимость и не называет точные сроки публичного запуска. Это типичная практика для новых аппаратных решений: сначала идёт обкатка на корпоративных заказчиках, затем масштабирование.
Открытым остаётся вопрос цены. Чипы Cerebras дороги в производстве, и пока неясно, как это отразится на тарифах для конечных пользователей. Влияние режима на повседневное использование станет понятно после того, как OpenAI расширит доступ и опубликует детали.
Пока можно сказать одно: технология работает, и результаты тестов впечатляют. Но массовому пользователю придётся подождать.
Что это значит для будущего AI
Ускорение генерации до 750 токенов в секунду открывает новые сценарии использования AI. Интерактивные приложения, голосовые ассистенты, системы реального времени - всё это становится ближе к практической реализации. Ответы перестают быть узким местом в цепочке взаимодействия.
Для бизнеса это означает более быструю обработку запросов клиентов, оперативный анализ финансовых данных, мгновенную реакцию на инциденты. Снижение задержек делает AI-сервисы удобнее и расширяет их применимость.
Это шаг к более быстрым и доступным AI-системам, хотя многое зависит от стоимости и масштабирования. Если Cerebras сможет нарастить производство и снизить цену чипов, ускоренные модели станут стандартом, а не премиальной опцией.
Похожие подходы к ускорению мы разбирали на примере метода Intel для Qwen3-8B на ноутбуках и ускорения StarCoder в 7 раз на процессорах Xeon. Там тоже решалась задача снижения задержек без потери точности, но другими методами.
Обновление GPT-5.6 Sol и его возможности мы рассматривали в разборе настроек API для ARC-AGI-3 и дайджесте недели с GPT-5.6.