AllSpark выпустила Iris-mini и Iris-pro: что важно знать об открытых поисковых AI-агентах
AllSpark представила два открытых поисковых AI-агента: Iris-mini на 35 млрд параметров и Iris-pro на 397 млрд. Разбираем, как их обучали «обратным ходом», почему управление контекстом оказалось важнее размера модели и что это значит для вашей работы.
Что случилось: AllSpark представила два поисковых AI-агента
Китайская лаборатория AllSpark выпустила два открытых поисковых AI-агента: Iris-mini на 35 млрд параметров и Iris-pro на 397 млрд. Обе модели построены на базе серии Qwen, обе работают с контекстом 256 000 токенов, а веса и код уже лежат на Hugging Face и GitHub.
По заявлению команды, Iris-mini и Iris-pro показывают лучшие результаты среди открытых поисковых агентов в своих классах. Это пока слова разработчиков, независимых тестов нет. Но сам релиз важен по другой причине: открытые агенты, которые сами ходят в интернет за фактами, перестают быть редкостью.
Чем поисковый агент отличается от обычного чат-бота
Обычный чат-бот отвечает на основе того, что запомнил во время обучения. Спросите у него о событии недельной давности, и он может уверенно выдать устаревшую информацию или просто додумать деталь. Поисковый агент устроен иначе: он сам формулирует запросы, открывает страницы, читает их, сверяет данные и только потом отвечает.
Разница примерно как между «спросить у знатока» и «отправить помощника в библиотеку». Знаток отвечает быстро, но только в пределах своих знаний. Помощник идёт за свежими данными, приносит ссылки и показывает, откуда взял каждую цифру.
На практике такие агенты нужны там, где важна свежесть: мониторинг новостей, сбор фактов для отчёта, проверка цен и условий, подготовка обзоров. Скажем, нужно выяснить, что три конкурента написали в своих блогах за последний месяц. Агент соберёт это сам, без ручного переписывания ссылок.
Iris-mini и Iris-pro: в чём разница и что общего
Параметры - условная мера сложности модели. Чем их больше, тем больше нюансов она способна учитывать и тем дороже обходится в работе. Iris-mini с 35 млрд параметров запускается на одной мощной видеокарте. Iris-pro с 397 млрд требует серьёзного оборудования и стоит заметно больше.
| Характеристика | Iris-mini | Iris-pro |
|---|---|---|
| Параметров | 35 млрд | 397 млрд |
| Контекст | 256 000 токенов | 256 000 токенов |
| Базовая серия | Qwen | Qwen |
| Тип | поисковый агент | поисковый агент |
| Веса и код | доступны | доступны |
Токен - это небольшой кусочек текста, в среднем несколько символов. 256 000 токенов вмещают примерно 200 000 слов. В такой объём входит целая книга или крупный отчёт с таблицами, и агент удерживает его в работе, не теряя нить рассуждения.
Обе модели заявлены как лучшие в своих классах. Класс здесь определяется размером: mini соревнуется с компактными агентами, pro с крупными. Сравнения с закрытыми моделями в релизе нет, поэтому ставить Iris рядом с топовыми коммерческими системами пока не на чем.
Почему управление контекстом важнее, чем размер модели
Авторы отдельно отмечают: управление контекстом во время работы часто влияет на результат сильнее, чем разница между самими моделями. Акцент неожиданный, ведь релизы обычно соревнуются в размере и количестве параметров.
Управление контекстом - это умение агента решать, какую часть накопленной информации оставить в работе, а какую отбросить. Задача длинная: агент открыл двадцать страниц, диалог разросся. Если тащить всё подряд, важное тонет в мусоре. Если структурировать и чистить, модель работает точнее.
Аналогия простая. Человек с блокнотом, который записывает каждое слово, утонет в собственных записях. Человек, который выписывает только ключевое, дойдёт до вывода быстрее.
Как тестировали агентов с управлением контекстом и без
AllSpark сравнивала агентов в двух режимах: с включённым управлением контекстом и с выключенным. Такой тест разводит два вклада: пользу от самого механизма и пользу от размера модели. В релизах агентов так делают редко, обычно показывают только итоговую цифру.
Результаты различались, и заметно. Отсюда практический вывод: не всегда нужно гнаться за самой крупной моделью. Средняя модель с грамотным управлением контекстом может обойти крупную, если у той контекст разваливается на длинной задаче. Похожий эффект уже наблюдался, когда две настройки API помогли GPT-5.6 втрое улучшить результат на ARC-AGI-3 без изменения самой модели.
Как обучали Iris: нестандартный подход «обратным ходом»
Обычный путь такой: придумывают вопрос, потом ищут ответ. AllSpark пошла от обратного. Команда брала готовые веб-страницы со ссылками и строила задания из самой структуры этих ссылок: чтобы дойти до ответа, агент должен пройти по цепочке страниц.
Подход даёт два плюса. Задания получаются реалистичными, потому что взяты из живой сети, а не придуманы в лаборатории. И их можно генерировать массово, без ручного труда.
Дальше ответы проходили двухэтапную фильтрацию. Первый этап отсеивал явный брак, второй проверял качество оставшихся решений. Затем шло чередование дообучения и обучения с подкреплением: агента сначала учили на примерах, как по учебнику, а потом закрепляли навык на практике, поощряя правильные шаги и штрафуя за ошибки.
Обучение с подкреплением простыми словами - метод, при котором модель получает сигнал «так правильно» или «так нет» и постепенно выстраивает поведение, приносящее лучший результат. Схоже с дрессировкой, только вместо лакомства числовая оценка.
Побочный эффект: модели улучшились в задачах, которым их не учили
Обучение поиску дало неожиданный результат. Модели стали лучше справляться с задачами, которым их специально не учили: работа с инструментами и офисные сценарии. Навык искать и проверять информацию переносится на смежные умения.
Логика такая. Поиск данных в интернете - это последовательность шагов: поставить цель, выбрать источник, проверить, сопоставить, сделать вывод. Та же последовательность нужна, чтобы заполнить таблицу, собрать отчёт из нескольких файлов или разложить встречу по календарю.
Для читателя, далёкого от разработки, это важнее самих цифр бенчмарков. Агент, который умеет планировать поиск, легче встраивается в рутинные офисные процессы: подготовку сводок, сверку данных, сбор информации по клиентам. Как такие агенты уже меняют реальные задачи, видно в разборе про AI-агентов в научных вычислениях, где счёт времени идёт с месяцев на дни.
Что уже доступно и что обещают позже
Веса моделей и код уже выложены на Hugging Face и GitHub. Разработчики и энтузиасты могут скачать, запустить и протестировать Iris-mini и Iris-pro на своих задачах. Для компактной версии достаточно одной мощной видеокарты.
Пайплайнов подготовки данных и обучения пока нет. Пайплайн - это набор скриптов и инструкций, которые описывают весь процесс: как собрать данные, как их отфильтровать, как провести обучение. Без него готовой моделью пользоваться можно, а повторить обучение с нуля нельзя.
Команда обещает опубликовать пайплайны позже. Для открытого проекта это обычная практика: сначала отдают то, что уже работает, потом документируют процесс. Если вы только присматриваетесь к теме агентов, начните с обзора Transformers Agents 2.0 от Hugging Face, где разобрано, как устроены фреймворки для создания таких систем.
Можно ли доверять заявлениям AllSpark
Честная картина такая. Все ключевые утверждения о характеристиках и результатах Iris-mini и Iris-pro взяты из описания релиза и не подтверждены независимыми тестами. Формулировку «лучшие результаты среди открытых поисковых агентов в своих классах» даёт команда AllSpark, а не сторонние исследователи.
Это нормальная ситуация, а не повод для подозрений. Разработчики почти всегда заявляют о превосходстве, а независимые бенчмарки потом расставляют всё по местам. Иногда цифры подтверждаются, иногда оказываются скромнее.
Что делать с этой информацией: держать в голове, что заявления требуют проверки, и следить за независимыми оценками и отзывами сообщества. Осторожность уместна, ведь даже у сильных агентов есть потолок. В эксперименте с самостоятельными исследованиями AI-агентов шесть дней работы и серьёзные ресурсы не принесли прорыва.
Что это значит для вас: практические выводы
- Открытых поисковых агентов становится больше, и порог входа снижается. Модели можно скачать и попробовать без разрешений и подписок.
- Управление контекстом влияет на результат сильнее, чем размер модели. При выборе инструмента смотрите не только на число параметров, но и на то, как он держит длинную задачу.
- Побочные эффекты обучения расширяют применение. Агент, натренированный на поиск, пригодится в офисных задачах, даже если вы не программист.
- Окончательные выводы делать рано. Независимых тестов нет, пайплайны не опубликованы.
Что можно сделать прямо сейчас. Если у вас есть техническая команда, скачайте Iris-mini и проверьте модель на своей задаче: это дешевле, чем ждать чужих отчётов. Если нет, достаточно следить за обновлениями и независимыми рейтингами, чтобы понимать направление.
Главный тренд здесь шире одного релиза. Прогресс открытых агентов всё меньше зависит от размера и всё больше от качества обучения и управления контекстом.
Есть вопрос или заметили неточность? Напишите нам, разберёмся вместе.