Inkling Small: почему эффективность важнее размера в гонке ИИ
Thinking Machines выпустила Inkling Small — модель, которая при меньшем размере не уступает флагманам в ключевых тестах и радикально экономит токены. Разбираем, почему это меняет правила игры в ИИ.
Inkling Small: новый подход к силе ИИ
Лаборатория Thinking Machines, основанная бывшим техническим директором OpenAI Мирой Мурати, выпустила вторую модель - Inkling Small. Команда сделала ставку на компактность. При менее чем трети параметров от старшей модели Inkling, новая версия отстает от нее всего на один балл в индексе интеллекта: 40 против 41. Это прямой сигнал рынку: эффективность становится важнее гигантомании.
Ключевое преимущество Inkling Small - экономия токенов. Токен - это единица текста, которую модель обрабатывает. Каждый сгенерированный токен стоит денег. Inkling Small тратит в среднем 24 тысячи выходных токенов на задачу. Для сравнения: Deepseek V4 Flash расходует 45 тысяч, а GPT-5.4 mini - 78 тысяч. Разница в два-три раза напрямую влияет на бюджет любого проекта, использующего ИИ.
Кто создал Inkling Small и зачем
Thinking Machines с первого дня заявляла: будущее не за самыми большими моделями, а за самыми умными в расходовании ресурсов. Первая модель компании, Inkling, уже выделялась на фоне конкурентов открытыми весами и архитектурой Mixture-of-Experts с 975 миллиардами параметров. Стартап предлагал бизнесу не просто инструмент, а фундамент для кастомизации через платформу Tinker. Подробнее о первой модели Inkling и платформе Tinker.
С Inkling Small вектор сместился еще дальше от погони за бенчмарками. Задача - дать рынку модель, которая решает практические задачи быстро и дешево. Меньше параметров - меньше вычислительных затрат - ниже счет за API. Для компаний, которые делают тысячи запросов в день, это экономия, измеряемая десятками процентов от бюджета на ИИ.
Что такое эффективность токенов и почему это важно
Каждый раз, когда модель отвечает на ваш вопрос, она генерирует последовательность токенов. Чем длиннее ответ, тем больше токенов, тем выше стоимость. Inkling Small решает задачи лаконичнее конкурентов. На одной и той же задаче она выдает 24 тысячи токенов, тогда как GPT-5.4 mini - 78 тысяч. Это не просто цифры. Это деньги, которые бизнес платит за каждый запрос.
Представьте: компания обрабатывает 10 тысяч запросов в день. С моделью, тратящей 78 тысяч токенов на запрос, расходы растут линейно. С Inkling Small - падают втрое. При этом качество ответов сопоставимо, а в ряде тестов - выше. Выбор в пользу эффективной модели - прямой контроль над бюджетом, без компромиссов по качеству.
Inkling Small против старшей модели: неожиданные результаты тестов
Компактность не означает слабость. Inkling Small обходит старшую Inkling в тестах на кодинг и рассуждение. Humanity's Last Exam - сложный междисциплинарный тест - пройден с результатом 32% против 30%. GPQA Diamond, вопросы уровня аспирантуры по физике, химии и биологии, - 89% против 87%. Это практические навыки: логика, генерация кода, анализ данных. Для автоматизации бизнес-процессов они критичны.
Модель поддерживает текст, изображения и речь. Окно контекста - 256 тысяч токенов. Этого достаточно для обработки больших документов или длинных диалогов. Лицензия Apache 2.0 разрешает коммерческое использование и модификацию без обязательства открывать доработки. Веса доступны на Hugging Face. Дообучение - прямо в браузере через Tinker Playground, без аренды серверов.
Где Inkling Small сильнее: кодинг и сложные рассуждения
Тесты показывают: модель лучше справляется с задачами, требующими логических цепочек и генерации кода. Написание скриптов, отладка, анализ структурированных данных - здесь Inkling Small выигрывает у старшей версии. Для технических специалистов и менеджеров проектов это означает: можно автоматизировать рутинные операции с кодом без привлечения тяжелых и дорогих моделей.
Результат Humanity's Last Exam в 32% - это решение задач на стыке дисциплин, где требуется синтез знаний. GPQA Diamond с 89% - ответы на вопросы, которые ставят в тупик многих людей с научной степенью. Модель не просто «меньше», она лучше в конкретных прикладных сценариях. Похожий подход использует Laguna S 2.1 - компактная модель для кодинга, решающая задачи 50-летней давности.
Где Inkling Small уступает: агентные задачи и фактические знания
Ограничения есть. Агентные задачи - многошаговые сценарии с использованием внешних инструментов, долгосрочным планированием и сложными цепочками действий - даются Inkling Small хуже, чем старшей модели. Здесь сказывается меньший объем параметров: модель менее изобретательна в поиске нестандартных путей.
Фактические знания - энциклопедическая информация, редкие факты, специфические детали - тоже зона преимущества большой Inkling. Больше параметров позволяют хранить больше информации. Для большинства бизнес-сценариев эти ограничения некритичны: компании редко нуждаются в энциклопедичности, им нужны точные ответы на узкие вопросы по их внутренним данным. А это решается дообучением.
Цена ошибки: как неэффективные модели бьют по бюджету
История Amazon - отрезвляющий пример. Компания потеряла 1,8 миллиона долларов из-за неконтролируемого расхода токенов при использовании Claude Sonnet. Бюджет на одну задачу превысили на 860%. Другие внутренние проекты также пострадали: 541 тысяча долларов перерасхода на инструментах финансового аудита и 134 тысячи - на оптимизации логистики.
После этих инцидентов Amazon начала внедрять автоматические механизмы контроля затрат. Но проблема решается проще: выбором модели с низким расходом токенов на старте. Если бы в проектах использовалась модель с эффективностью Inkling Small, масштаб потерь был бы значительно меньше. Вопрос соотношения стоимости ИИ и человеческого труда становится все острее.
Доступность и настройка: модель, которую можно адаптировать под себя
Inkling Small распространяется под лицензией Apache 2.0. Это означает: модель можно свободно использовать в коммерческих продуктах, модифицировать, встраивать в свои сервисы. В отличие от GPL, Apache 2.0 не требует открывать исходный код доработок. Юридические риски минимальны, порог входа для бизнеса низкий.
Веса модели выложены на Hugging Face. Дообучение доступно через Tinker Playground - среду, работающую прямо в браузере. Процесс прост: загружаете свои примеры, модель подстраивается под ваш стиль, терминологию и форматы ответов. Не нужно арендовать GPU-серверы или настраивать сложное ПО. Это демократизирует ИИ: кастомизация доступна не только программистам.
Что значит лицензия Apache 2.0 для бизнеса
Apache 2.0 - одна из самых дружественных для коммерции открытых лицензий. Она явно разрешает использование в проприетарных продуктах, модификацию и распространение измененных версий. Компания не обязана публиковать свои улучшения. Это снижает юридические риски и ускоряет внедрение: юристы тратят меньше времени на анализ лицензионных ограничений.
Дообучение в браузере: это проще, чем кажется
Tinker Playground позволяет загрузить набор примеров «вопрос-ответ» в вашей предметной области. Модель анализирует их и корректирует свои ответы, перенимая стиль и специфику. Не нужно писать код, настраивать гиперпараметры или разбираться в тонкостях файн-тюнинга. Результат - модель, которая говорит на языке вашего бизнеса и понимает вашу терминологию. Google также движется в сторону специализации: Gemini 3.6 Flash экономит до 65% токенов.
Что это значит для будущего ИИ: тренд на эффективность
Inkling Small - часть глобального сдвига. Компании все чаще выбирают не самые мощные, а самые эффективные модели. Это снижает затраты, упрощает внедрение и делает ИИ доступнее для среднего бизнеса. Рынок уходит от гонки параметров к гонке за экономичностью.
Выбор модели теперь - это не только сравнение бенчмарков. Это расчет стоимости владения: сколько токенов тратится на задачу, какова цена за миллион токенов, можно ли дообучить модель под свои данные. Inkling Small показывает: «меньше» может означать «лучше» для реальных задач. Эффективность токенов, открытая лицензия и простота кастомизации - три фактора, которые меняют правила игры. Даже настройки API могут радикально улучшить результат без изменения модели.