Kog: как французский стартап ускоряет ИИ-инференс на обычных GPU в 30 раз

Kog: как французский стартап ускоряет ИИ-инференс на обычных GPU в 30 раз

Французский стартап Kog заявляет об ускорении обработки ИИ-запросов на стандартных GPU в 30 раз. Разбираем, как работает технология, почему это снизит стоимость инференса и чего ждать к сентябрю 2026 года.

Французский стартап Kog заявляет, что стандартные дата-центровые GPU, такие как AMD MI300X и Nvidia H200, могут обрабатывать ИИ-запросы в 30 раз быстрее. Секрет не в новом железе, а в программной оптимизации. Основатель компании Гаэль Делалло планирует доказать это на больших языковых моделях к сентябрю 2026 года. Уже сейчас 200 потенциальных клиентов ждут подтверждения.

Скорость и стоимость инференса стали главным барьером для массового внедрения ИИ. Если технология Kog сработает, экономика всей отрасли изменится. Разберём, как это устроено, почему это важно и какие риски остаются.

Проблема: почему инференс стал узким местом ИИ

Обучение модели - разовое событие. Инференс - постоянный процесс. Каждый раз, когда вы задаёте вопрос чат-боту или просите нейросеть сгенерировать изображение, сервер выполняет вычисления. Эти вычисления требуют мощных GPU, электричества и времени. Для бизнеса это превращается в ежемесячные счета и задержки ответов.

Что такое инференс и почему он дорогой

Инференс - это момент, когда обученная модель отвечает на запрос. В отличие от обучения, которое происходит один раз, инференс идёт непрерывно. Тысячи пользователей одновременно отправляют запросы, и каждый требует вычислительных ресурсов. Стоимость складывается из аренды GPU в облаке или расходов на собственные серверы, плюс электроэнергия и охлаждение. Чат-бот, обрабатывающий 10 000 запросов в секунду, требует десятков видеокарт, работающих круглосуточно.

Скорость и стоимость - главные барьеры для внедрения ИИ

Инференс может составлять до 90% стоимости владения ИИ-системой. Компании упираются в простой расчёт: каждый дополнительный пользователь ИИ-функции увеличивает счёт за инфраструктуру. Медленные ответы ухудшают пользовательский опыт, люди уходят. Бизнес вынужден ограничивать доступ к ИИ-инструментам или выбирать менее качественные, но более дешёвые модели. Это сдерживает инновации и не даёт проектам масштабироваться.

По данным исследования VentureBeat 2026, 83% компаний используют свои GPU менее чем на половину, а 44% вообще не ведут учёт затрат на ИИ-вычисления. Этот «вычислительный разрыв» съедает бюджеты. Подробнее о проблеме мы писали в статье «ИИ-инфраструктура: почему компании тратят быстрее, чем считают».

Решение Kog: оптимизация ПО вместо нового железа

Kog не разрабатывает новые чипы. Стартап утверждает, что существующие GPU работают значительно ниже своих возможностей из-за неэффективного программного обеспечения. Их подход - переписать низкоуровневые операции, улучшить планирование вычислений и убрать накладные расходы. Это как настроить двигатель автомобиля для большей мощности без замены деталей.

Как работает оптимизация GPU для ИИ

Современные GPU - сложные устройства с тысячами вычислительных ядер. Часто они простаивают, ожидая данные из памяти или выполнения зависимых операций. Программный код, который управляет вычислениями, может быть написан неоптимально: лишние копирования данных, неэффективное распределение задач между ядрами, узкие места в коммуникации. Kog, судя по заявлениям, работает именно на этом уровне - ускоряет взаимодействие между компонентами и заставляет железо работать ближе к теоретическому пределу.

Похожий подход используют и другие игроки. Например, OpenAI в партнёрстве с Cerebras представила режим Ultrafast для GPT-5.6 Sol, который ускоряет генерацию до 750 токенов в секунду. Это в 14 раз быстрее стандартного режима. Мы разбирали эту технологию в статье «OpenAI представляет Ultrafast: ответ на запрос бизнеса в скорости ИИ-обработки данных».

Заявленные результаты: 30-кратное ускорение

Kog демонстрирует ускорение обработки запросов в 30 раз на стандартных дата-центровых GPU. Это означает, что один и тот же сервер может обслуживать в 30 раз больше запросов без покупки дополнительного оборудования. Стоимость одного запроса падает пропорционально. Если сейчас обработка 1000 запросов стоит $10, то с технологией Kog - около $0.33. Для бизнеса это разница между «дорого, но можно» и «дёшево, масштабируем без ограничений».

Почему это важно для индустрии ИИ

Ускорение инференса на существующем железе меняет правила игры. Компаниям не нужно ждать следующего поколения чипов или платить премию за новейшие ускорители. Они могут выжать больше из того, что уже установлено в дата-центрах. Это снижает порог входа для малого бизнеса и ускоряет эксперименты с ИИ.

Экономический эффект для бизнеса

Если компания тратит $100 000 в месяц на GPU для инференса, ускорение в 30 раз может снизить расходы до $3 300. Либо компания оставляет бюджет прежним, но обслуживает в 30 раз больше клиентов. Для стартапов это возможность конкурировать с гигантами без многомиллионных вложений в инфраструктуру. Для среднего бизнеса - шанс внедрить ИИ там, где раньше это было нерентабельно.

Влияние на массовое внедрение ИИ

Снижение стоимости инференса похоже на то, как падение цен на хранение данных привело к буму облачных сервисов. Когда обработка запроса стоит копейки, компании начинают использовать ИИ в каждом процессе: поддержка клиентов, анализ документов, генерация контента, прогнозирование спроса. Отрасли, которые выиграют первыми: здравоохранение (обработка медицинских изображений), финансы (анализ транзакций в реальном времени), ритейл (персонализированные рекомендации).

Архитектурные решения тоже играют роль. Модели на основе Mixture of Experts уже показывают, как можно ускорить инференс без потери качества. Мы объясняли принцип работы MoE в статье «Mixture of Experts: как одна архитектура ускоряет ИИ и меняет правила игры».

Планы Kog и скептицизм экспертов

Заявления о 30-кратном ускорении звучат впечатляюще, но требуют доказательств. Пока Kog не опубликовала независимых бенчмарков, а технические детали остаются закрытыми. Рынок заинтересован, но осторожен.

Дорожная карта: демонстрация на LLM к сентябрю 2026

Гаэль Делалло заявил, что к сентябрю 2026 года компания продемонстрирует ускорение на больших языковых моделях. LLM - самый требовательный класс ИИ-систем, поэтому успешная демонстрация станет сильным аргументом. Если Kog покажет заявленные цифры на реальных моделях уровня GPT или Llama, доверие к технологии вырастет кратно.

Интерес рынка: 200 потенциальных клиентов

Kog утверждает, что привлекла внимание 200 потенциальных клиентов. Это подтверждает высокий спрос на решения по ускорению инференса. Однако потенциальные клиенты - не то же самое, что платящие. Многие ждут независимых подтверждений, прежде чем подписывать контракты.

Что вызывает сомнения

Нет публичных технических деталей о том, как именно работает оптимизация. Неизвестно, сохраняется ли ускорение на разных типах моделей и нагрузок. Возможны скрытые ограничения: например, ускорение только для определённых операций или архитектур. История знает примеры, когда заявления о прорыве не подтверждались независимыми тестами. Стартап Etched, привлёкший $300 млн на разработку чипов без GPU, столкнулся со скептицизмом индустрии. Мы разбирали их кейс в статье «Стартап Etched: как чипы без GPU меняют рынок AI и привлекают миллиарды».

Что это значит для вас: практические выводы

Даже если технология Kog не оправдает всех ожиданий, тренд на оптимизацию инференса останется. Компании, которые уже сейчас занимаются эффективностью вычислений, получат преимущество. Вот что можно сделать.

Как подготовиться к изменениям

Проведите аудит текущих затрат на инференс. Посчитайте, сколько вы платите за GPU, какова их реальная загрузка. Изучите доступные методы оптимизации: квантование моделей, дистилляция, спекулятивное декодирование. Эти техники уже сейчас позволяют снизить расходы без потери качества. Следите за развитием Kog и других стартапов в этой области. Возможно, пилотный проект с оптимизацией ПО окупится быстрее, чем покупка нового оборудования.

Вопросы, которые стоит задать Kog

Если вы рассматриваете сотрудничество с Kog, задайте прямые вопросы. На каких моделях и задачах достигнуто ускорение? Есть ли независимые бенчмарки от третьих сторон? Как технология интегрируется с существующей инфраструктурой? Каковы ограничения и стоимость внедрения? Ответы на эти вопросы помогут отделить реальные возможности от маркетинговых обещаний.

Оптимизация инференса - это гонка, в которой участвуют и гиганты, и стартапы. OpenAI уже показала, что скорость можно увеличить в 14 раз с помощью партнёрства с Cerebras. Мы подробно разбирали этот кейс в статье «Cerebras ускоряет GPT-5.6 Sol: как работает режим Ultrafast». Если Kog докажет свои заявления, конкуренция за скорость и стоимость станет ещё жёстче. А выиграют от этого все, кто использует ИИ в работе.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции