Google WikiSkill: как ИИ-агенты учатся на прошлых ошибках через постоянную базу знаний

Google WikiSkill: как ИИ-агенты учатся на прошлых ошибках через постоянную базу знаний

Google WikiSkill учит ИИ-агентов использовать прошлый опыт: сохранять ошибки, превращать удачные решения в навыки и применять их в новых задачах. Разбираем три уровня системы, результаты в математике и работе с таблицами, а также ограничения постоянной базы знаний.

Google Research представила WikiSkill, подход для ИИ-агентов, который помогает сохранять опыт между запусками. Агент записывает удачные решения и ошибки, затем превращает накопленный материал в инструкции для будущих задач.

WikiSkill строится вокруг постоянной базы знаний с тремя уровнями: сырые данные, вики со структурированными знаниями и слой готовых навыков. По данным описания исследования, подход заметно улучшил результаты моделей в математике и работе с таблицами, а небольшие модели с WikiSkill в отдельных тестах приблизились к более крупным моделям без такой базы.

Для пользователя это означает более последовательную работу ИИ. Агент может учитывать прошлый опыт, не повторять уже найденные ошибки и быстрее выбирать подходящую процедуру.

Проблема: ИИ-агенты забывают всё после каждого запуска

Большинство ИИ-агентов получает контекст только на время текущей задачи. После завершения сессии сведения о действиях, промежуточных результатах и неудачных попытках могут исчезнуть. При следующем запуске агент снова действует почти с чистого листа.

Представим агента, который обрабатывает таблицу с продажами. В первой попытке он перепутал строки с заголовками и получил неверный итог. Если этот опыт нигде не сохранён, при следующем похожем запросе агент способен повторить ту же ошибку. Человеку пришлось бы заново объяснять структуру файла и проверять каждый шаг.

Такая модель работы ограничивает эффективность ИИ-агентов в длинных процессах. Задачи приходится повторно уточнять, успешные приёмы теряются, а исправление ошибок не превращается в устойчивое улучшение.

Обычная память агента решает лишь часть проблемы. Она может хранить факты или предыдущие сообщения, но не всегда превращает историю действий в понятную процедуру. Контекст отвечает на вопрос «что уже сказано», а накопленный навык должен отвечать на вопрос «как лучше действовать в похожей ситуации».

Похожую проблему разбирает материал о втором агенте, который выборочно напоминает основной системе о прошлых ошибках и важных требованиях: как AI-агенты забывают свои ошибки.

Что такое WikiSkill: база знаний, которая растёт с опытом

WikiSkill, это подход Google Research к накоплению и повторному использованию опыта ИИ-агента. Система сохраняет последовательность действий, условия задачи, результат и оценку качества. В записи остаются успешные решения и ошибки, если они помогают понять, какой путь не следует повторять.

База знаний WikiSkill не обнуляется после завершения отдельного запуска. Она пополняется новыми наблюдениями, связывает похожие случаи и постепенно формирует набор повторно используемых инструкций.

Например, агент несколько раз работает с электронными таблицами. В его истории появляются сведения о том, какие форматы данных приводили к сбоям, как проверять заголовки и в какой последовательности выполнять расчёты. После обработки этих записей агент получает навык, который можно применить к новой таблице.

Подход отличается от обычного обучения модели. При дообучении меняются параметры самой модели, а WikiSkill сохраняет опыт в отдельном хранилище и подаёт нужные знания агенту во время работы. Такой способ позволяет обновлять инструкции без полного переобучения.

Три уровня WikiSkill: от сырых данных к готовым навыкам

Архитектура WikiSkill разделяет опыт на три уровня. Каждый следующий слой делает информацию более компактной, структурированной и пригодной для повторного применения.

Сырые данные: фиксация каждого шага

На первом уровне сохраняется история работы агента. В неё входят:

  • исходная задача и её контекст;
  • действия агента в хронологическом порядке;
  • промежуточные ответы и использованные инструменты;
  • полученный результат;
  • ошибки, исправления и признаки успешного решения.

Такая запись похожа на подробный журнал работы. Если агент решает математическую задачу, система может сохранить выбранную формулу, порядок вычислений, промежуточные значения и итоговую проверку. Неверный результат тоже остаётся в истории, поскольку он показывает, какой шаг привёл к сбою.

Сырые данные полезны для анализа, но сами по себе неудобны для быстрого поиска. В большом журнале трудно найти нужный случай, а повторяющиеся записи могут содержать лишний шум.

Вики со знаниями: превращение опыта в структуру

На втором уровне записи обрабатываются и объединяются в более общие знания. Система выделяет повторяющиеся ситуации, удаляет лишние детали и связывает связанные наблюдения.

Из нескольких эпизодов работы с таблицами может появиться правило: перед расчётами нужно проверить названия столбцов, типы данных и наличие пустых значений. Это уже не описание одной сессии, а обобщённая запись, которую можно применить к разным файлам.

Вики-уровень помогает организовать знания по темам и условиям применения. Отдельные записи могут описывать работу с формулами, сортировкой, поиском аномалий или проверкой итоговых значений. Агент получает возможность найти нужную информацию по задаче, а не просматривать всю историю запусков.

Качество обобщения здесь критично. Если система сделает слишком широкий вывод из одного неудачного примера, ошибочное правило попадёт в базу и начнёт влиять на будущие ответы.

Слой навыков: готовые инструкции для агента

На третьем уровне знания превращаются в навыки. Навык, это короткая процедура или набор подсказок, которые агент может применить в новой задаче.

Например, навык для работы с таблицами может включать такую последовательность:

  1. Определить заголовки и границы таблицы.
  2. Проверить типы значений в ключевых столбцах.
  3. Найти пустые, дублирующиеся и явно ошибочные записи.
  4. Выполнить расчёт.
  5. Сверить итог с исходными данными и промежуточными значениями.

Инструкция становится полезной, когда содержит условия применения и критерии проверки. Фраза «проверь таблицу» слишком общая. Правило «перед суммированием проверь, что числовой столбец не содержит текстовых значений» задаёт агенту конкретное действие.

Навыки позволяют переносить опыт между похожими задачами. Агенту не нужно хранить в активном контексте всю историю прошлых запусков, достаточно получить релевантную инструкцию в нужный момент.

Контроль качества: фильтр от ошибок

Между уровнями WikiSkill нужен контроль качества. Без него постоянная база знаний может накапливать противоречия, устаревшие правила и неверные выводы.

Проверка должна отвечать на несколько вопросов:

  • Подтверждается ли правило несколькими успешными примерами?
  • Не противоречит ли новая запись уже сохранённому знанию?
  • В каких условиях инструкция работает?
  • Есть ли у результата независимая проверка?
  • Не устарело ли правило после изменения данных или инструментов?

Часть проверок можно автоматизировать. Например, система способна сравнивать результат с эталонным ответом, запускать повторный расчёт или отслеживать частоту сбоев после добавления нового навыка. Для неоднозначных случаев может потребоваться человек, который подтвердит или отклонит обобщение.

Контроль качества связывает память агента с надёжностью. Ошибка, сохранённая без проверки, превращается в повторяемую ошибку. Проверенное наблюдение становится рабочим знанием.

Результаты тестов: WikiSkill улучшает работу моделей

В описании исследования WikiSkill показал заметное улучшение результатов моделей в задачах, где полезна последовательность действий и повторное использование опыта. Самый выраженный эффект отмечен в математике и работе с таблицами.

Улучшение в математике и работе с таблицами

Математические задачи требуют аккуратного порядка шагов. Ошибка в одном промежуточном вычислении меняет итог, поэтому агенту полезно помнить, какие проверки помогли избежать сбоя в прошлом.

Если несколько похожих задач уже решались успешно, WikiSkill может сохранить рабочую схему: выделить известные величины, выбрать формулу, выполнить расчёт по этапам и проверить ответ обратным действием. Такая инструкция снижает вероятность пропуска промежуточного шага.

В таблицах похожая логика связана с качеством данных. Агенту приходится распознавать структуру файла, отличать числа от текста, учитывать пропуски и проверять итоговые значения. Накопленный опыт помогает закрепить порядок этих действий.

Речь не идёт о гарантии безошибочной работы. Результат зависит от качества записей, самой модели и условий теста. WikiSkill даёт агенту дополнительный опыт, который можно использовать при решении новых задач.

Меньшие модели догоняют большие

Один из практических выводов исследования связан с размером модели. Небольшие модели, дополненные WikiSkill, в отдельных сценариях приблизились по результатам к более крупным моделям без постоянной базы знаний.

Для компаний это может снизить требования к вычислительным ресурсам. Меньшая модель обычно быстрее отвечает и дешевле работает, а накопленные навыки компенсируют часть разрыва в способности решать повторяющиеся задачи.

Такой эффект особенно полезен в процессах с устойчивыми правилами: обработке внутренних документов, проверке таблиц, подготовке типовых отчётов и последовательной аналитике. Модель получает поддержку в форме проверенных процедур, а не полагается только на общие способности.

Конкретные численные метрики, размеры моделей и условия сравнений в предоставленном описании не приведены. Поэтому корректнее говорить о приближении результатов в отдельных тестах, а не о полном равенстве моделей.

Почему WikiSkill важен для будущего ИИ

Постоянная память меняет представление об ИИ-агенте. Он может становиться полезнее через накопление опыта, а качество работы зависит не только от выбранной модели, но и от того, насколько хорошо организованы её знания.

В офисных задачах такой подход может помочь агенту запомнить правила подготовки отчётов, формат внутренних документов и типичные ошибки в данных. В аналитике он способен сохранять проверенные последовательности расчётов. В научной работе база навыков может фиксировать процедуры проверки и требования к доказательствам.

Сочетание памяти и контроля качества приближает агентные системы к длительной работе. Агент получает возможность накапливать историю решений, применять проверенные процедуры и уточнять их после новых результатов.

WikiSkill вписывается в общий переход от отдельных ответов к рабочим процессам, где ИИ выполняет серию действий и отвечает за промежуточные результаты. Похожие вопросы о проверке работы агентов разобраны в статье о том, как ИИ ускоряет научное программное обеспечение, сохраняя необходимость контроля экспертов: ИИ-агенты ускоряют науку, но не заменяют учёных.

Ограничения и открытые вопросы

Главный риск WikiSkill связан с закреплением неверных знаний. Если агент ошибся, а система записала его решение как успешное, ошибка может повторяться в новых задачах.

Есть и другие ограничения:

  • устаревшие навыки могут перестать работать после изменения инструментов или форматов данных;
  • противоречивые правила усложняют выбор подходящей инструкции;
  • большая база знаний повышает требования к поиску и отбору записей;
  • слишком подробная память может перегружать агента лишним контекстом;
  • автоматическая оценка качества подходит не для каждого типа задач.

Масштабирование остаётся отдельным вопросом. Чем больше агент выполняет задач, тем сложнее поддерживать актуальность вики, удалять дубли и отслеживать связи между навыками.

Предоставленные материалы описывают WikiSkill на уровне идеи и основных слоёв. Подробности технической реализации, точные метрики и условия тестирования требуют изучения полного исследования. Поэтому подход стоит воспринимать как перспективное направление, а не как готовую универсальную замену обучению моделей или человеческой проверке.

Заключение: WikiSkill как шаг к ИИ с памятью

WikiSkill помогает ИИ-агентам сохранять опыт между запусками. Система собирает сырые данные, превращает их в структурированные знания и формирует готовые навыки, которые можно применять в новых задачах.

Тесты показали улучшение в математике и работе с таблицами. В отдельных сценариях небольшие модели с WikiSkill приблизились к крупным моделям без такой поддержки. Практическая ценность подхода связана с возможностью использовать накопленный опыт вместо повторного решения одной и той же проблемы.

Надёжность зависит от контроля качества. Без проверки база может закрепить ошибки, а при грамотной фильтрации она становится рабочим инструментом для более стабильных ИИ-агентов.

WikiSkill показывает направление развития AI: агент должен отвечать не только на текущий запрос, но и учиться на истории собственных действий. Есть вопрос или заметили неточность? Сообщите редакции, чтобы мы могли уточнить материал.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции