Новый почасовой тариф: когда ИИ-агенты дорожают людей
METR представила метрику «горизонт расходов»: тест NanoGPT speedrun показал, что ИИ-модели проигрывают человеку при бюджете от $3300. Узнайте, когда выгоднее нанимать людей, а когда — использовать алгоритмы, и почему эти цифры уже устарели.
Что такое «горизонт расходов» и почему METR взялась за эту задачу
Исследовательская организация METR (Model Evaluation and Threat Research) предложила метрику «горизонт расходов». Она показывает, при каком бюджете ИИ-агент становится менее эффективным, чем человек. Простыми словами: это точка, после которой дешевле нанять специалиста, чем платить за вычисления ИИ.
Рост возможностей искусственного интеллекта породил иллюзию, что алгоритмы выгоднее людей в любой задаче. Компании массово внедряют автоматизацию, не всегда просчитывая реальную экономику. METR решила внести ясность и дать инструмент для взвешенных решений.
Почему нам нужна такая метрика?
Бизнес регулярно переплачивает за ИИ на малых масштабах. Автоматизация поддержки, генерация контента, анализ данных - в каждой из этих сфер человек может оказаться выгоднее при ограниченном бюджете. Проблема в том, что руководители не имеют простого способа сравнить затраты.
Метрика «горизонт расходов» решает эту проблему. Она переводит разговор об эффективности ИИ из плоскости абстрактных возможностей в плоскость конкретных цифр. Вы видите бюджет задачи и сразу понимаете: отдать её агенту или делегировать сотруднику.
Ранее мы рассказывали, как финансовый директор OpenAI предложила скоркард из четырёх метрик для оценки выгоды от ИИ. Исследование METR продолжает эту линию - оно даёт конкретный экономический порог, а не общие рекомендации.
NanoGPT speedrun: как тестировали ИИ и человека
Для сравнения METR выбрала задачу NanoGPT speedrun - быструю настройку и обучение небольшой языковой модели. Этот тест требует технических навыков и творческого подхода. Он репрезентативен: отражает реальную работу с ИИ-инструментами, где нужны и инженерное мышление, и способность к нестандартным решениям.
Исследователи замеряли, сколько времени и денег тратит человек (с учётом его почасовой оплаты) и сколько - ИИ-агенты (стоимость API-вызовов и вычислений). Единицей эффективности выбрали улучшение качества модели на 1%. Такой подход позволяет сравнивать принципиально разные ресурсы - человеческий труд и машинные вычисления - в одной системе координат.
Какие модели ИИ участвовали в тесте
METR тестировала GPT-5.5 и Opus-4.8. Это модели предыдущего поколения. Они не отражают текущий уровень технологий. Новейшие системы демонстрируют значительно лучшие способности к самостоятельному решению задач. Авторы исследования прямо указывают: их выводы - срез на конкретный момент, а не вечная истина.
Выбор устаревших моделей объясним. Во-первых, исследование требует времени на подготовку и проведение. Во-вторых, результаты для старых версий создают базовую линию, от которой можно отталкиваться при оценке прогресса. Скорость развития ИИ такова, что любое тестирование рискует устареть к моменту публикации.
Цифры: когда ИИ проигрывает человеку
Человек тратит около $2500 на улучшение качества модели на 1%. ИИ-агенты на базе GPT-5.5 и Opus-4.8 начинают проигрывать при бюджетах от $3300. Это означает: если у вас есть задача с бюджетом до $3300, ИИ может быть выгоднее. Если бюджет больше - человек пока эффективнее.
Разрыв выглядит так: до отметки $2500-3300 алгоритмы и люди идут примерно вровень. Затем эффективность ИИ-агентов падает. Они продолжают потреблять вычислительные ресурсы, но качество результата растёт медленнее, чем при работе специалиста. Кривая затрат человека более пологая и предсказуемая.
Эти цифры важны для планирования. Компания, которая тратит $5000 на ИИ-агентов для сложной аналитической задачи, вероятно, переплачивает. Те же деньги, вложенные в работу эксперта, принесли бы более качественный результат.
О схожей логике мы писали в материале про «вычислительный разрыв»: 83% компаний используют GPU менее чем наполовину, а 44% вообще не ведут учёт затрат на ИИ-вычисления. Без контроля расходов метрика «горизонт расходов» теряет смысл - вы просто не увидите, где теряете деньги.
Почему эти выводы уже устарели (и что будет дальше)
Скорость развития ИИ такова, что новые модели учатся решать задачи быстрее и дешевле. Агенты на базе последних версий GPT и Claude показывают кратный рост эффективности. «Горизонт расходов» будет сдвигаться вверх. Цифра $3300, полученная для GPT-5.5, для новых систем может оказаться в разы выше.
Исследование METR - моментальный снимок. Через полгода после публикации оно уже не отражает реального соотношения сил. Читателю важно следить за обновлениями и не принимать решения на основе устаревших данных. ИИ-агенты дешевеют, их возможности растут, и точка безубыточности постоянно смещается.
Показателен пример из сферы кибербезопасности: компактные модели Cisco Antares обнаруживают примерно в 150 раз больше уязвимостей на каждый потраченный доллар по сравнению с крупными AI-агентами. Специализация и оптимизация меняют экономику быстрее, чем можно зафиксировать в одном исследовании.
Как использовать метрику уже сегодня
При оценке проекта сравнивайте стоимость человека и ИИ не в абсолютных цифрах, а в динамике. Задавайте три вопроса. Насколько задача творческая? Требует ли она уникальной экспертизы? Как быстро меняются модели в этой области?
Если задача рутинная и хорошо алгоритмизируется - ставка на ИИ оправдана даже при текущих ограничениях. Если нужна глубокая экспертиза и нестандартные решения - человек остаётся более надёжным выбором. Метрика «горизонт расходов» работает как точка отсчёта, а не как догма.
Практический совет: раз в квартал пересчитывайте экономику своих AI-проектов. Модели дешевеют, появляются специализированные решения. То, что было невыгодно в январе, может окупиться в апреле. Управление вычислительными ресурсами ИИ становится таким же важным навыком, как управление командой.
Что это значит для вашего бизнеса: три вывода
Первый. Не спешите полностью заменять людей ИИ. На сложных, дорогих задачах человек всё ещё может быть выгоднее. Исследование METR даёт конкретный ориентир - $3300 для моделей прошлого поколения. Для новых систем порог выше, но он существует.
Второй. Постоянно пересчитывайте экономику. Модели дешевеют и умнеют. Затраты, которые сегодня кажутся оправданными, завтра станут избыточными. И наоборот: задача, которую сейчас выгоднее отдать человеку, через месяц может эффективно решаться агентом.
Третий. Используйте метрику «горизонт расходов» как инструмент планирования бюджета на AI-проекты. Она даёт простой и понятный критерий для принятия решений. Внедряйте учёт затрат на ИИ-вычисления - без этого любые сравнения теряют смысл.
Рынок движется к гибридным решениям. Человек и алгоритм не конкурируют, а дополняют друг друга. Задача руководителя - найти точку равновесия для каждого типа работ. Метрика METR помогает сделать этот поиск осознанным и измеримым.