Как экономить на ИИ-моделях: опыт разработчика, создавшего собственный многоагентный конвейер

Как экономить на ИИ-моделях: опыт разработчика, создавшего собственный многоагентный конвейер

Разработчик Бартош Котрыс из Quesma создал многоагентный конвейер из Claude, Codex и Antigravity, чтобы в 10 раз увеличить время исследования и сократить расходы токенов. Разбираем ключевые приемы экономии: разбивка задач, дешевые модели, перекрестная проверка и автоматическое переключение подписок.

Разработчик Бартош Котрыс из компании Quesma столкнулся с ситуацией, знакомой многим пользователям ИИ-сервисов: за полчаса работы режим Deep Research в Claude Max полностью исчерпал лимит его подписки. Вместо того чтобы смириться с ограничениями, он собрал собственную систему из нескольких моделей - Claude, Codex и Antigravity - и объединил их общей памятью через плагин claude-mem. Результат: время непрерывного исследования выросло примерно в десять раз, а дублирование работы агентов сошло на нет.

Этот кейс - практический ответ на вопрос, как снизить затраты на ИИ без потери качества. Котрыс не изобретал новые модели и не взламывал тарифы. Он пересобрал процесс: разбил задачи на этапы, доверил простые операции дешёвым моделям, настроил перекрёстную проверку фактов и автоматическое переключение между подписками. Каждый из этих приёмов можно применить в своих проектах - от автоматизации рутины до глубоких исследований.

Почему Deep Research в Claude Max съедает лимит за полчаса

Бартош Котрыс запустил Deep Research в Claude Max с типичной задачей - провести анализ темы, собрать источники, сопоставить выводы. Через 30 минут подписка закончилась. Проблема не в конкретном сервисе и не в «жадности» провайдера. Корень - в самом подходе «один агент - одна задача», который порождает лавинообразное расходование токенов.

Когда одна модель выполняет сложное исследование, она генерирует множество внутренних итераций: читает источники, переформулирует запросы, проверяет гипотезы, возвращается к предыдущим шагам. Каждый такой цикл потребляет токены. При этом часть работы повторяется - модель заново обрабатывает контекст, который уже был проанализирован на предыдущем шаге. Отсюда и мгновенное исчерпание лимита.

Что такое токены и почему они быстро заканчиваются

Токен - это единица текста, которую обрабатывает языковая модель. Грубо: одно слово - это 1-2 токена, предложение из десяти слов - 10-20 токенов. Модель «думает» токенами: каждый запрос пользователя, каждый сгенерированный ответ, вся история диалога пересчитываются в токены. Тарифицируются и входящие данные (запрос), и исходящие (ответ).

Deep Research умножает этот расход. Обычный диалог с моделью - это линейная цепочка: запрос, ответ, новый запрос. Deep Research внутри себя создаёт дерево запросов: модель ищет информацию, анализирует её, решает, что нужно уточнить, снова ищет, сравнивает, синтезирует. Десятки итераций за один пользовательский запрос. Каждая итерация - это сотни и тысячи токенов. За полчаса такой работы лимит подписки уходит полностью.

Похожая проблема возникает и в других сценариях. В разборе проблемы генерализации от создателей MiniMax M2 показано, как потеря контекста сессии разрушает производительность агента. Очистка истории - это обнуление памяти, после которого модель начинает с нуля и сжигает токены заново.

Многоагентный конвейер: как объединить Claude, Codex и Antigravity

Котрыс пошёл по пути разделения труда. Вместо одного универсального агента он выстроил конвейер из трёх специализированных моделей. Claude отвечает за генерацию идей и стратегическое планирование - он определяет, что именно нужно исследовать и в каком порядке. Codex выполняет техническую работу: пишет и запускает код, парсит данные, форматирует результаты. Antigravity ищет информацию в источниках и собирает фактуру.

Такая архитектура решает главную проблему одиночного агента - смешение задач разной сложности в одном потоке. Claude не тратит дорогие токены на парсинг веб-страниц. Codex не пытается рассуждать о стратегии исследования. Каждый делает то, для чего оптимизирован. Этот подход перекликается с экспериментом Cursor по разделению AI-агентов на планировщиков и исполнителей, где разделение контекста между мощными и дешёвыми моделями сократило затраты до 15 раз и снизило число конфликтов слияния в 70 раз.

Зачем нужна общая память и как работает claude-mem

Три агента - это три изолированных «мозга». Без общей памяти каждый начинает работу с нуля: Claude формулирует план, но Codex не знает этого плана и запрашивает контекст заново. Antigravity ищет источники, которые Claude уже находил минутой ранее. Дублирование работы съедает токены и время.

Плагин claude-mem решает эту проблему. Он выступает единой памятью конвейера - сохраняет результаты каждого агента и делает их доступными для остальных. Claude записал план - Codex видит его и сразу приступает к выполнению. Antigravity нашёл источник - Claude использует его для следующего шага, не запуская поиск повторно. Устранение дублирования дало тот самый десятикратный прирост времени непрерывного исследования.

Похожий принцип мультиагентного взаимодействия заложен и в системе код-ревью в Claude Code от Anthropic: вместо одного критика работает команда специализированных агентов, которые ищут ошибки независимо, а затем перепроверяют находки друг друга. Общая память - это фундамент, на котором держится любая многоагентная архитектура.

4 приема экономии токенов, которые сработали на практике

Конвейер Котрыса опирается на четыре конкретные тактики. Каждая из них снижает расход токенов и при этом сохраняет - или даже повышает - качество результата.

Разбивка задач: меньше токенов за шаг

Один большой запрос «исследуй тему X и напиши отчёт» порождает гигантский контекст. Модель держит в памяти всё сразу: источники, промежуточные выводы, структуру будущего отчёта. Каждый следующий шаг дорожает, потому что контекст разбухает.

Котрыс разбивает исследование на серию маленьких шагов: «найди пять источников по теме X», «суммируй каждый источник одним абзацем», «сравни выводы из источников 1 и 3», «сформулируй общий вывод на основе сравнения». Каждый шаг - это короткий контекст и предсказуемое количество токенов. Модель не пережёвывает гигантский объём информации на каждой итерации. Суммарный расход токенов получается ниже, чем при монолитном подходе.

Дешевые модели для черновой работы

Стоимость токенов у разных моделей отличается в разы. Claude на сложных задачах оправдывает свою цену качеством рассуждений. Но для парсинга веб-страницы, форматирования текста или простого поиска по ключевым словам его мощность избыточна. Котрыс отдаёт такие задачи Codex и Antigravity - они справляются не хуже, а стоят дешевле.

Практическое правило из этого кейса: проанализируйте свои типовые запросы к ИИ и выделите те, что не требуют глубокого анализа. Простой запрос к базе данных, конвертация форматов, извлечение имён и дат из текста - всё это кандидаты на передачу дешёвой модели. Дорогую модель подключайте только там, где нужны рассуждения, синтез или стратегическое планирование.

Перекрестная проверка: двойная выгода

Ошибка дорого обходится. Если агент сгенерировал неверный вывод, а пользователь заметил это позже, приходится переделывать всю цепочку работы - а это новые токены. Котрыс встроил в конвейер перекрёстную проверку: один агент формулирует утверждение, другой проверяет его по источникам.

Обнаружение ошибки на раннем этапе требует минимальных затрат - исправить одно утверждение дешевле, чем переписывать весь отчёт. Параллельно растёт точность результата. Этот же принцип заложен в мультиагентном код-ревью Claude Code, где независимая проверка разными агентами повышает надёжность и одновременно снижает риск дорогостоящих переделок.

Автоматическое переключение подписок

У каждой подписки есть лимит токенов. Когда лимит исчерпан, работа останавливается - если не настроено автоматическое переключение. Котрыс реализовал логику, при которой система отслеживает остаток токенов по текущей подписке и при достижении порога переключается на резервную. Исследование продолжается без пауз и ручного вмешательства.

Этот приём требует нескольких активных подписок и базовой автоматизации, но даёт непрерывность работы. Для небольших проектов альтернативой может быть маршрутизатор моделей вроде Fugu Ultra от Sakana AI, который сам выбирает оптимальную модель под запрос и балансирует нагрузку между разными провайдерами.

Результат: в 10 раз больше времени на исследование

До внедрения конвейера Бартош Котрыс получал 30 минут непрерывной работы Deep Research - и на этом подписка заканчивалась. После сборки многоагентной системы с общей памятью время выросло до нескольких часов. Прирост примерно в десять раз достигнут за счёт устранения дублирования: каждый агент использует результаты работы других, а не начинает с нуля.

Качество не пострадало. Разделение труда между Claude, Codex и Antigravity в сочетании с перекрёстной проверкой фактов даёт результат не хуже, чем у одиночного мощного агента. Разница в том, что конвейер расходует токены осмысленно - дорогие модели делают только ту работу, для которой они нужны, а всё остальное уходит на дешёвые.

Как применить этот подход в своих проектах

Повторить путь Котрыса можно без глубокой технической экспертизы. Достаточно начать с анализа текущих затрат и постепенно внедрять элементы конвейера.

Первый шаг - посчитайте, на что уходят токены сейчас. Какие задачи вы решаете с помощью ИИ? Сколько раз вы платите за повторную обработку одного и того же контекста? Есть ли операции, которые можно выделить в отдельные простые запросы?

Второй шаг - определите, какие задачи можно отдать дешёвым моделям. Составьте список: парсинг, форматирование, простой поиск, конвертация данных. Для каждого пункта подберите модель с оптимальным соотношением цены и качества. Не обязательно использовать именно Codex и Antigravity - подойдут любые доступные вам аналоги.

Третий шаг - настройте общую память. Плагин claude-mem - один из вариантов. Существуют и альтернативы: векторные базы данных для хранения контекста, low-code платформы для оркестрации агентов, даже простая файловая система с сохранением промежуточных результатов. Главное - чтобы каждый следующий агент в цепочке получал доступ к выводам предыдущего.

Четвёртый шаг - начните с малого. Автоматизируйте один повторяющийся процесс: например, еженедельный сбор новостей по теме или проверку данных перед публикацией. Отладьте конвейер на нём, измерьте экономию токенов и только потом расширяйте систему.

Типичная ошибка - пытаться сразу построить идеальную архитектуру. Реальная экономия приходит через итерации: запустили простую связку из двух моделей, замерили результат, добавили третью, настроили переключение подписок. Постепенное усложнение даёт контролируемый рост эффективности без риска сломать рабочие процессы.

Опыт Котрыса показывает: проблема быстрого исчерпания лимитов решается не увеличением бюджета на подписки, а пересборкой процесса. Многоагентный конвейер с разделением труда и общей памятью - это практический шаблон, который можно адаптировать под задачи любого масштаба.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции