Малые языковые модели на устройстве: где SLM уже полезнее облачной LLM
Локальные модели уже выигрывают у облачных там, где важны приватность, мгновенный ответ, офлайн-работа и экономия на запросах. Разбираем, что такое SLM и on-device, и даем таблицу выбора под конкретные задачи.
Малые языковые модели (SLM) на устройстве уже выигрывают у облачных LLM в четырех ситуациях: когда данные нельзя отправлять на чужие серверы, когда нужен мгновенный ответ без задержки сети, когда интернета нет и когда важно не платить за каждый запрос. В остальных случаях, особенно при глубоком анализе и работе со свежими знаниями, облачная модель по-прежнему сильнее.
Выбор между локальной и облачной моделью перестал быть спором о мощности. Теперь это вопрос приоритета: приватность, скорость, автономность или качество ответа. Разберем каждый критерий отдельно, с примерами и оговорками о том, какие данные подтверждены, а какие стоит считать предварительными.
Статус фактов сразу: даты и цифры проверены на 20 сентября 2026 года. Быстро меняющиеся сведения об устройствах и приложениях помечены отдельно, чтобы вы понимали, где через полгода ситуация может измениться.
Что такое SLM и чем она отличается от облачной LLM
SLM (Small Language Model, малая языковая модель) - компактная модель, которая помещается на смартфон, ноутбук или другое личное устройство и работает прямо на нем. LLM (Large Language Model, большая языковая модель) обычно размещена на серверах компании и доступна по интернету: вы отправляете запрос и ждете ответа.
Бытовая аналогия: локальная модель похожа на калькулятор в кармане, облачная - на суперкомпьютер, к которому вы обращаетесь по запросу. Калькулятор отвечает мгновенно и работает без сети, но считает только то, что умеет. Суперкомпьютер знает больше, но до него нужно дозвониться.
Ключевые термины простыми словами
- SLM - малая языковая модель. Размер подбирают так, чтобы она работала на обычном железе.
- LLM - большая языковая модель. Требует серверов, зато справляется со сложными задачами.
- On-device («на устройстве») - обработка данных прямо на вашем телефоне или ноутбуке, без отправки в облако.
- Параметры - условный размер модели, число внутренних настроек, которые она учитывает при генерации ответа. Чем их больше, тем обычно выше качество и тем больше нужно памяти. Запись 27B означает 27 миллиардов параметров.
- Инференс - работа модели по выдаче ответа. Обучение и инференс - разные этапы: модель один раз обучают, а затем она отвечает пользователям.
Граница между SLM и LLM размыта: она зависит от железа и момента времени. Модель, которая год назад требовала сервера, сегодня помещается в смартфон.
Почему on-device SLM стала реальностью именно сейчас
Рост вычислительной мощности смартфонов и оптимизация самих моделей сдвинули границу: то, что раньше считалось серверной задачей, теперь запускается локально. По данным издания WCCFTech, iPhone 18 Pro запускает модель на 27 миллиардов параметров примерно вдвое быстрее, чем iPhone 17 Pro (wccftech.com).
Этот пример стоит воспринимать с оговоркой: он опирается на единственный источник, независимого подтверждения в доступных материалах нет. Считать его доказательством общего тренда нельзя, но как ориентир он показывает направление.
Параллельно развиваются компактные модели. Hugging Face выпустила SmolVLM с 256 и 500 миллионами параметров - одни из самых маленьких мультимодальных моделей, которые понимают изображения и текст (разбор SmolVLM). Liquid AI представила LFM2.5-2.6B - агентную модель, которая планирует задачи и работает на смартфоне без интернета (обзор LFM2.5-2.6B).
Что здесь факт, а что прогноз. Факт: конкретные устройства запускают локальные модели заявленного размера, и на рынке есть модели от сотен миллионов до нескольких миллиардов параметров. Прогноз: в ближайшие годы локальные модели возьмут на себя больше типовых задач, которые сейчас уходят в облако.
Приватность: когда данные не должны покидать устройство
Облачные ассистенты запоминают ваши обращения, и это дает им контекст. Обратная сторона: чем больше вы делитесь, тем больше остается на серверах. WIRED описывает механику памяти ChatGPT: функция появилась в апреле 2024 года, тогда нужно было явно сказать «запомни это»; после обновления в июне бот сохраняет и перебирает воспоминания автоматически, со временем редактируя их (wired.com).
Важная деталь: память можно отключить, но это не удаляет уже сохраненное. Ассистент перестанет ссылаться на старые записи, хотя хранить их продолжит (wired.com).
Как облачные ассистенты запоминают лишнее
Ошибки памяти обычно безобидны по замыслу, но неприятны по эффекту. Если вы неделю искали, как заменить выключатель, ассистент может решить, что вы энтузиаст DIY. Если вы изучали кафе и отели в городе, куда едете в отпуск, он может посчитать, что вы там живете. Это не злой умысел, а особенность работы памяти: модель строит догадки из разрозненных сигналов.
On-device SLM снимает часть этих рисков: данные не покидают устройство, потому что обработка идет локально. Это не значит, что облако всегда небезопасно, у крупных провайдеров есть свои меры защиты. Речь о сценариях, где сам факт отправки данных наружу нежелателен: личные заметки, рабочие документы, медицинские записи, переписка.
Локальные модели уже берут на себя разбор экранов и документов. Например, LFM2.5-VL-3B понимает изображения и текст, занимает около 3 ГБ памяти и анализирует таблицы и скриншоты (обзор LFM2.5-VL-3B).
Задержка и автономность: когда каждая секунда и отсутствие сети важны
Облачная модель добавляет к ответу сетевой round-trip: запрос уходит на сервер, обрабатывается, ответ возвращается. На хорошем соединении это доли секунды, в метро или самолете - минуты ожидания или отказ. On-device SLM отвечает сразу, потому что запрос не покидает устройство.
Автономность хорошо видно на примере приложения Renkin: оно собирает устанавливаемые наборы иконок для Android прямо на телефоне, без ПК, без аккаунта и без подключения к сети, код открыт под лицензией GPLv3 (appteka.store). Это не языковая модель, но наглядно показывает принцип: обработка на устройстве работает там, где облако недоступно.
Для задач реального времени локальный подход предпочтительнее: перевод в поездке, подсказки в интерфейсе, распознавание речи. Сравнивать скорость SLM и облачных LLM напрямую мы не будем: прямых бенчмарков в доступных источниках нет.
Стоимость: когда облако становится дорогим
Облачные LLM чаще всего тарифицируются за токены (единицы текста) или через подписку. Каждый запрос стоит денег, и при высокой частоте обращений расходы растут. On-device SLM не требует оплаты за отдельные запросы: вы платите один раз за устройство и за электроэнергию.
Пример смежной задачи - транскрибация встреч. Компания GPTunneL описала транскрибер, который записывает звонок, расшифровывает его и отправляет резюме с принятыми решениями (gptunnel.ru). Если такая обработка нужна каждый день и касается чувствительных переговоров, локальный аналог на базе SLM может оказаться и дешевле, и безопаснее.
Точных цифр по сравнению стоимости on-device и облачных решений в источниках нет, поэтому конкретные суммы не приводим. Логика простая: чем чаще повторяется задача и чем меньше в ней нужен тяжелый интеллект, тем выгоднее локальный вариант.
Ограничения on-device SLM: где локальные модели пока проигрывают
Качество SLM ограничено размером модели и возможностями железа. Материалы не содержат прямых бенчмарков, которые сравнивали бы качество малых локальных и больших облачных моделей, поэтому честная позиция такая: преимущество локальных решений подтверждено в приватности, задержке и автономности, а в качестве - нет.
Отдельная оговорка про пример с iPhone 18 Pro и 27B-моделью: он опирается на один источник. Пока независимые измерения не опубликованы, это скорее сигнал тренда, чем доказанный факт.
Качество и сложные задачи
Облачные LLM сильнее в длинных рассуждениях, в работе с большим объемом текста и в узкоспециальных знаниях. Локальные модели показывают себя на простых и повторяемых операциях: краткое резюме, перевод, черновик письма, распознавание речи.
Еще один риск - галлюцинации, то есть уверенные, но неверные ответы. Он есть у моделей любого размера, и малые модели ему подвержены не меньше. Любой результат, на который вы опираетесь в работе, стоит проверять.
Практические критерии выбора: SLM или облачная LLM
Начните с вопроса о данных. Если текст нельзя отправить на чужой сервер, выбор фактически один - локальная модель. Дальше смотрите на условия: есть ли стабильный интернет, сколько раз в день повторяется задача, насколько сложный ответ нужен.
Для оценки мобильных AI-решений появляются отдельные инструменты. Google обновил Android Bench для оценки AI в мобильной разработке, добавив фреймворк Harbor и метрику стоимости (гайд по Android Bench). Такие метрики помогают сравнивать варианты по деньгам, а не только по скорости.
Таблица решений: что выбрать в конкретной ситуации
| Сценарий | Что важнее | Рекомендация |
|---|---|---|
| Личные заметки, документы, переписка | Приватность | On-device SLM |
| Перевод и подсказки в поездке без сети | Автономность | On-device SLM |
| Ежедневная транскрибация встреч | Стоимость и приватность | SLM локально, облачный сервис как альтернатива |
| Разбор экранов, таблиц, сканов | Приватность и скорость | Мультимодальная SLM на устройстве |
| Глубокий анализ рынка, длинный отчет | Качество и объем контекста | Облачная LLM |
| Свежие новости и актуальные данные | Свежесть знаний | Облачная LLM с доступом в интернет |
| Генерация идей и черновиков | Гибкость | Оба варианта, зависит от конфиденциальности |
Таблица не заменяет тест на своих задачах. Возьмите одну повторяющуюся операцию, попробуйте решить ее локально и сравните результат с привычным облачным сервисом: разница в удобстве проявится быстрее, чем в цифрах.
Что это значит для вас: практические выводы
Для обычного пользователя сдвиг означает больше контроля: чувствительные данные можно обрабатывать, не отправляя их в облако, а ответы получать сразу. Для бизнеса это возможность снизить расходы на API и закрыть требования к хранению данных, хотя полностью отказаться от облачных моделей в сложных задачах пока не получится.
Переходить целиком на локальные модели не обязательно. Разумный подход - выбрать одну-две повторяющиеся задачи и попробовать решить их на устройстве, а сложные сценарии оставить облаку. Рынок меняется быстро: сведения об устройствах и приложениях в этой статье датированы 20 сентября 2026 года.
Есть вопрос или заметили неточность? Напишите нам, и мы обновим материал.