Как научить ИИ «видеть» экран: пошаговый рецепт от Hugging Face

Как научить ИИ «видеть» экран: пошаговый рецепт от Hugging Face

Hugging Face показали, как за два этапа научить нейросеть SmolVLM2 видеть экран и управлять интерфейсом. Точность выросла с 0% до 62%. Код и данные в открытом доступе.

Команда Hugging Face опубликовала открытый рецепт обучения языковых моделей работе с графическим интерфейсом. Исследователи взяли модель SmolVLM2 с 2,2 млрд параметров, которая изначально не умела распознавать элементы на экране, и за два этапа научили её кликать, печатать и прокручивать. Точность выросла с 0% до 62% на профессиональном бенчмарке. Код, данные и обученная модель выложены в открытый доступ.

Этот результат меняет представление о возможностях небольших моделей. Ещё недавно управление компьютером через GUI считалось задачей для гигантских нейросетей с сотнями миллиардов параметров. Теперь появился воспроизводимый подход, доступный каждому, кто владеет базовым Python.

Зачем учить ИИ работать с интерфейсами

Большинство программ, которыми мы пользуемся ежедневно, не имеют программного интерфейса (API). Единственный способ автоматизировать работу с ними - взаимодействие через графический интерфейс: кнопки, поля ввода, выпадающие списки. Модель, способная «видеть» экран и выполнять действия, открывает дорогу к автоматизации миллионов рутинных задач.

Примеры практического применения:

  • заполнение типовых форм и отчётов в корпоративных системах;
  • сбор данных с веб-страниц, где нет готового API;
  • помощь людям с ограниченными возможностями - голосовое управление любым приложением;
  • автоматическое тестирование пользовательских интерфейсов.

Это шаг к универсальным ИИ-ассистентам, которые работают не внутри одного сервиса, а на уровне всей операционной системы. Технология, которую Hugging Face сделали открытой, приближает это будущее.

Почему это сложно: что значит «видеть» экран для модели

Для нейросети скриншот - набор пикселей. Там нет кнопок, полей ввода или текста. Есть цветовые значения точек. Человек, открывая новое приложение, мгновенно выделяет знакомые паттерны: прямоугольник с тенью - кнопка, пустая область с курсором - поле ввода. Модели этому нужно учить с нуля.

SmolVLM2 - компактная модель на 2,2 млрд параметров, оптимизированная для работы с изображениями и текстом. До обучения она не могла определить, где на скриншоте находится кнопка «Войти» или поле «Пароль». Исследователи Hugging Face показали: проблема решается правильной методикой обучения, а не наращиванием размера модели. Это ключевой вывод для всех, кто работает с ограниченными вычислительными ресурсами.

Платформа Hugging Face последовательно делает AI доступнее - от инструментов для ускорения вывода нейросетей в 100 раз до развития Spaces для демо-приложений. Открытый рецепт обучения GUI-агентов продолжает эту линию.

Два этапа обучения: от распознавания к планированию

Методика Hugging Face делится на две стадии. Сначала модель учит «алфавит» интерфейса - где какие элементы находятся. Затем - «составлять предложения»: планировать цепочки действий для достижения цели.

Этап 1: Базовое понимание интерфейса

Первый этап построен на датасете из скриншотов с аннотациями. Каждый скриншот размечен: для всех значимых элементов указаны координаты ограничивающих рамок и тип - кнопка, поле ввода, выпадающий список, флажок, текстовая метка. Модель училась сопоставлять пиксельные паттерны с объектами и их назначением.

Процесс похож на то, как ребёнок учится различать предметы на картинках: сначала запоминает форму и положение, потом связывает с функцией. После этого этапа SmolVLM2 начала уверенно находить элементы интерфейса и определять их тип. Но действовать осмысленно ещё не могла.

Этап 2: Рассуждение и планирование действий

Второй этап добавил цепочки рассуждений. Модель получала задачу - например, «войти в аккаунт на сайте» - и училась разбивать её на шаги: найти поле логина, кликнуть в него, ввести текст, найти поле пароля, ввести пароль, нажать кнопку «Войти». Каждый шаг сопровождался объяснением, почему выбрано именно это действие.

Этот подход опирается на технику chain-of-thought - модель проговаривает рассуждение перед действием. Результат: SmolVLM2 научилась не просто видеть элементы, а выстраивать последовательности операций. Именно этот скачок дал основной прирост точности.

Результат: точность 62% и что это значит на практике

На профессиональном бенчмарке для оценки GUI-агентов точность выросла с 0% до 62%. Бенчмарк включает задачи разной сложности: от клика по одной кнопке до заполнения многостраничных форм с переходами между экранами.

62% - значительный результат для открытой модели такого размера. Коммерческие аналоги часто используют нейросети в десятки раз крупнее и показывают сопоставимые цифры. При этом SmolVLM2 можно запустить на одной потребительской видеокарте.

Модель хорошо справляется с простыми сценариями: найти и нажать кнопку, ввести текст в поле, выбрать значение из выпадающего списка. Ошибки возникают на сложных интерфейсах с нестандартными элементами или когда требуется учесть контекст, выходящий за пределы текущего скриншота. Это честный результат, который показывает и прогресс, и границы применимости.

Как попробовать самому: открытый код и данные

Все материалы опубликованы на GitHub и Hugging Face Hub. Модель, датасеты, скрипты для обучения и инструкция по воспроизведению доступны без ограничений.

Минимальные требования для запуска:

  • Python 3.10 или новее;
  • видеокарта с 16 ГБ видеопамяти (подойдёт потребительская RTX 4080 или аналог);
  • библиотеки Transformers, PyTorch, OpenCV.

Порог входа низкий: базовых навыков Python достаточно, чтобы скачать модель и запустить её на своих скриншотах. Для дообучения под специфичные интерфейсы потребуется разметить несколько сотен примеров - процесс трудоёмкий, но технически несложный. Тем, кто работает с эмбеддингами и семантическим поиском, пригодится интеграция Sentence Transformers с Hugging Face Hub - она решает смежные задачи буквально в несколько строк кода.

Что дальше: будущее ИИ-агентов для управления компьютером

Планы Hugging Face и сообщества включают три направления: повышение точности на сложных интерфейсах, расширение набора поддерживаемых действий и интеграцию с реальными приложениями через API операционных систем. Открытый формат проекта позволяет подключаться к разработке независимым исследователям.

Аналогичные разработки ведут коммерческие компании - Adept с моделью ACT-1, стартапы вроде Imbue. Принципиальное отличие рецепта Hugging Face - полная открытость. Код можно изучить, модифицировать и встроить в собственный продукт без лицензионных отчислений.

Прогноз на ближайшие два-три года: GUI-агенты станут стандартным компонентом корпоративной автоматизации. Модели научатся работать с любыми интерфейсами без предварительного обучения под конкретное приложение. Открытые наработки Hugging Face ускоряют этот переход - каждый может взять готовый рецепт и адаптировать под свою задачу.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции