Google Cloud C4 на Intel Xeon 6: до 1.7x быстрее и на 70% дешевле для инференса больших ИИ-моделей

Google Cloud C4 на Intel Xeon 6: до 1.7x быстрее и на 70% дешевле для инференса больших ИИ-моделей

Совместный бенчмарк Intel и Hugging Face показал: новые VM Google Cloud C4 на процессорах Intel Xeon 6 дают до 1.7x прироста производительности на ядро при запуске MoE-модели GPT OSS. Узнайте, как это снижает стоимость владения до 70% и почему CPU становятся реальной альтернативой GPU для инференса.

Что показал бенчмарк: главные цифры

Совместный бенчмарк Intel и Hugging Face показал: новые виртуальные машины Google Cloud C4 на процессорах Intel Xeon 6 (Granite Rapids) дают до 1,7 раза больше производительности на одно виртуальное ядро по сравнению с предыдущим поколением C3. Тестировали на MoE-модели GPT OSS от OpenAI.

Что это означает на практике? При сопоставимой цене за ядро вы получаете заметно больше сгенерированных токенов за те же деньги. Общая стоимость владения (TCO) снижается до 70%. Это прямой выигрыш для любого, кто запускает большие языковые модели в продакшене.

Расшифруем термины, чтобы не осталось вопросов. MoE (Mixture of Experts, или «смесь экспертов») - архитектура модели, где для обработки каждого токена активируется лишь часть нейросети, несколько «экспертов», а не вся модель целиком. Инференс - этап применения уже обученной модели для получения результата, например, генерации текста. Токен - минимальная смысловая единица, которую модель обрабатывает: слово, часть слова или знак препинания.

Бенчмарк подтверждает: CPU-инстансы становятся реальной альтернативой GPU для задач инференса. Раньше считалось, что запуск больших ИИ-моделей требует видеокарт. Теперь это правило перестаёт быть абсолютным. Мы уже видели сигналы этого тренда - например, сделку на 400 млн долларов под залог inference-чипов SambaNova, где инвесторы сделали ставку на специализированное «железо» для выполнения моделей, а не на традиционные GPU.

Почему это важно: экономика инференса на CPU

CPU-инстансы доступнее и дешевле GPU. Для задач инференса, где не требуется максимальная параллельность вычислений, это критически важно. Вы платите меньше за аренду виртуальной машины, а теперь - благодаря C4 - получаете с каждого ядра больше полезной работы.

Рост производительности на ядро напрямую снижает стоимость одного токена. Если раньше для генерации миллиона токенов требовалось, условно, 100 ядер, то теперь хватит 60. При той же цене за ядро счёт за облачную инфраструктуру сокращается почти вдвое. Для MoE-моделей CPU особенно эффективны из-за разреженной активации экспертов: процессору не нужно постоянно держать в памяти и обсчитывать всю модель, он работает только с активными подсетями.

Это часть более широкого тренда: компании всё чаще ищут способы снизить расходы на ИИ-инфраструктуру. По данным исследования, 83% компаний используют GPU менее чем на половину, а 44% вообще не ведут учёт затрат на ИИ-вычисления. Переход на CPU для инференса - один из способов навести порядок в этом «вычислительном разрыве».

Сравнение C4 и C3: откуда взялся прирост

Intel Xeon 6 (Granite Rapids) принёс архитектурные улучшения, которые прямо повлияли на результат. Больше ядер на процессор - выше плотность вычислений. Улучшенная подсистема памяти - меньше задержек при обращении к данным модели. Новые процессорные инструкции ускоряют матричные операции, лежащие в основе нейросетей.

Выигрыш достигнут за счёт двух факторов одновременно: нового «железа» и переработанного кода. Одно без другого не дало бы такого скачка. Процессор получил больше вычислительных блоков, а софт научился эффективнее их загружать.

Программные оптимизации: как переписали обработку токенов в MoE

В MoE-моделях каждый токен обрабатывается только несколькими экспертами из всего набора. Наивная реализация часто вызывает лишние вычисления: код прогоняет токен через всех экспертов, а потом просто отбрасывает ненужные результаты. Это пустая трата процессорного времени.

Инженеры переработали логику обработки токенов. Теперь вычисления запускаются только для тех экспертов, которые действительно нужны для конкретного токена. Накладные расходы на переключение между экспертами и копирование данных устранены. Процессор загружается полезной работой, а не обслуживанием архитектурных издержек.

Результат: те же ядра выдают больше токенов в секунду. Прирост в 1,7 раза на ядро - это прямое следствие того, что код перестал мешать «железу» работать. Для тех, кто хочет глубже разобраться в оптимизации моделей под конкретное оборудование, Hugging Face выпустила инструмент Optimum для ускорения и квантования Transformer-моделей, который упрощает запуск на процессорах Intel Xeon.

Кому это нужно: сценарии использования

C4 на Xeon 6 подойдут нескольким категориям пользователей. Компании, запускающие большие языковые модели в продакшене, получат прямое снижение затрат на облако. Стартапы, которые считают каждый доллар инфраструктуры, смогут масштабироваться без резкого роста счетов. Разработчики, экспериментирующие с MoE-моделями, получат доступную среду для тестов.

Решение ориентировано на задачи, где важна стоимость предсказания, а не минимальная задержка. Если ваш сервис генерирует текст для пользователей и допустимая задержка - доли секунды, а не миллисекунды, CPU-инстансы становятся экономически оправданным выбором. C4 уже доступны в Google Cloud.

Intel активно развивает направление запуска ИИ на процессорах. Мы рассказывали, как инженеры Intel ускорили работу языковой модели Qwen3-8B на ноутбуках в 1,4 раза с помощью спекулятивного декодирования. Технологии, отработанные на серверных процессорах, постепенно приходят и на пользовательские устройства.

Когда CPU выгоднее GPU: простой пример

Представьте: вам нужно генерировать 1 миллион токенов в день. На GPU-инстансе среднего уровня это обойдётся примерно в 150 долларов в месяц при постоянной нагрузке. На C4 с сопоставимой производительностью - около 50 долларов. Разница возникает из-за того, что GPU-инстансы дороже в аренде, а для инференса MoE-моделей их параллельная мощь избыточна.

Для моделей с разреженной активацией CPU даёт лучшую цену при приемлемой скорости. Вы не жертвуете качеством сервиса, но сокращаете инфраструктурные расходы втрое. Это конкретная экономия, которую можно направить на развитие продукта.

Что это значит для рынка облачного ИИ

Intel и Google Cloud делают ставку на CPU для ИИ-нагрузок. Это прямая конкуренция с GPU-ориентированными решениями, которые доминировали последние годы. Участие Hugging Face в бенчмарке добавляет веса результатам: крупнейшая платформа для разработки ИИ-моделей подтверждает, что процессоры - это серьёзно.

Инференс больших моделей становится доступнее. Снижение порога входа ускорит внедрение ИИ в компаниях, которые раньше не могли позволить себе дорогую инфраструктуру. Это продолжение тренда на демократизацию технологий: вслед за открытыми моделями и фреймворками приходит доступное «железо» для их запуска.

Итог: стоит ли переходить на C4

Коротко: да, если вы уже используете C3 или рассматриваете CPU для инференса MoE-моделей. До 1,7 раза выше производительность на ядро. Стоимость владения ниже до 70%. Больше токенов за те же деньги. Это не маркетинговые обещания, а результаты независимого бенчмарка Intel и Hugging Face.

Для некоторых задач GPU остаются предпочтительнее - например, для обучения моделей или сценариев, где критична минимальная задержка. C4 расширяют выбор, а не отменяют альтернативы. Вы получаете ещё один инструмент для оптимизации затрат на ИИ-инфраструктуру, и в этот раз он действительно работает.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции