Как две настройки API помогли GPT-5.6 втрое улучшить результат на тесте ARC-AGI-3

Как две настройки API помогли GPT-5.6 втрое улучшить результат на тесте ARC-AGI-3

Два параметра API — сохранение цепочки рассуждений и режим уплотнения — позволили GPT-5.6 втрое улучшить результат на бенчмарке ARC-AGI-3 без изменения кода модели. Разбираем, как это работает и почему открытие упрощает жизнь разработчикам и бизнесу.

Что произошло: GPT-5.6 и тест на абстрактное мышление

GPT-5.6 - обновлённая модель OpenAI - показала трёхкратный рост результата на бенчмарке ARC-AGI-3. Прирост обеспечили два параметра API: сохранение цепочки рассуждений и режим уплотнения (compaction). Никаких изменений в коде модели не потребовалось.

ARC-AGI-3 проверяет способность ИИ решать абстрактные логические задачи, с которыми он раньше не сталкивался. Модель не может опереться на заученные шаблоны - только на умение выстраивать логику с нуля. Трёхкратное улучшение на таком тесте означает, что правильная настройка API может заменить месяцы дорогостоящей разработки новой архитектуры.

Этот результат ломает устоявшееся убеждение: раньше считалось, что для серьёзного прогресса на сложных бенчмарках нужна принципиально иная архитектура нейросети. Эксперимент с GPT-5.6 показал обратное - иногда достаточно грамотно распорядиться тем, что уже есть под рукой.

Почему ARC-AGI-3 - это сложный экзамен для ИИ

ARC-AGI-3 - бенчмарк, созданный для оценки гибкости мышления, а не объёма памяти. Задачи выглядят как последовательности абстрактных фигур, цветных сеток или геометрических паттернов. Модель должна уловить скрытое правило и применить его к новому примеру.

Человек с развитым логическим мышлением справляется с такими задачами интуитивно. Для ИИ это серьёзный вызов: каждая задача уникальна, и готового решения в обучающих данных нет. Модель вынуждена рассуждать, проверять гипотезы и корректировать выводы - именно то, что мы называем «мышлением», а не «распознаванием».

Высокий результат на ARC-AGI-3 - индикатор прогресса в создании более универсального ИИ. В Claude Opus 5 набрал 30,2% на бенчмарке ARC-AGI-3, почти в четыре раза обойдя предыдущий рекорд OpenAI в 7,8%. Модель впервые демонстрировала поведение, похожее на самостоятельное формулирование алгебраических уравнений для проверки гипотез. Конкуренция на этом бенчмарке обостряется, и каждый новый подход к настройке моделей приближает индустрию к более гибкому ИИ.

Два параметра, которые всё изменили

Оба параметра решают общую проблему: длинные цепочки рассуждений перегружают контекстное окно модели, и она начинает ошибаться. GPT-5.6 с включёнными настройками научилась удерживать фокус на главном и не терять промежуточные выводы. Разберём каждый параметр отдельно.

Сохранение цепочки рассуждений: почему важны промежуточные шаги

Представьте, что вы решаете сложную математическую задачу в уме. Через несколько операций вы забываете, с чего начали, и допускаете ошибку. Знакомая ситуация? Теперь представьте, что вы записываете каждый шаг на бумаге. Вероятность ошибки резко снижается.

Параметр «сохранение цепочки рассуждений» делает для модели то же самое. Вместо того чтобы пытаться удержать все промежуточные выводы в активной «памяти», GPT-5.6 фиксирует их. Каждый шаг остаётся доступным для последующих этапов рассуждения. Модель перестаёт «сбиваться» на середине пути и доводит логическую цепочку до конца.

На практике это критично для задач ARC-AGI-3, где требуется многоходовый анализ: найти закономерность, проверить её на одном примере, скорректировать гипотезу, проверить снова. Без сохранения шагов модель часто возвращалась к уже отвергнутым гипотезам или путала последовательность действий.

Режим уплотнения: как сжать контекст без потери смысла

Конспектирование лекции - хорошая аналогия. Вы не записываете каждое слово преподавателя, а выделяете главные мысли, отбрасывая повторы и риторические отступления. Режим уплотнения (compaction) работает так же: модель анализирует накопленный контекст и удаляет избыточную информацию, оставляя только значимые факты и выводы.

Это освобождает ресурсы контекстного окна. Модель может удерживать больше действительно важных данных вместо того, чтобы хранить три копии одного и того же вывода, сформулированного разными словами. Для длинных цепочек рассуждений это особенно ценно: объём контекста растёт с каждым шагом, и без уплотнения модель быстро упирается в лимит.

Вместе эти два параметра дали синергетический эффект. Сохранение цепочки фиксирует шаги, уплотнение не даёт им заполонить всю доступную «память». GPT-5.6 получила возможность рассуждать дольше и точнее - ровно то, что требуется для абстрактных логических задач.

Почему это открытие меняет правила игры

Разработка новой архитектуры нейросети - это месяцы работы исследовательских команд, миллионы долларов на обучение и непредсказуемый результат. Настройка двух параметров API занимает минуты и не требует специальных знаний. Разница в подходе колоссальна.

Для бизнеса это означает возможность быстрее адаптировать ИИ под конкретные задачи. Аналитический отдел, который генерирует сложные отчёты, логистическая компания, решающая задачи маршрутизации, юридическая фирма, анализирующая многостраничные контракты - все они могут улучшить качество работы ИИ без привлечения дорогих специалистов по машинному обучению.

Эксперимент с GPT-5.6 также подтверждает: потенциал существующих моделей раскрыт не полностью. Мы привыкли ждать следующего поколения нейросетей, а значительный прирост производительности может быть доступен уже сейчас - через грамотную настройку того, что есть. Это особенно важно для небольших команд с ограниченным бюджетом.

Что это значит для будущего AI-агентов

AI-агенты - системы, которые выполняют последовательности действий для достижения цели - напрямую выигрывают от обеих настроек. Агент, бронирующий билеты, должен помнить даты, предпочтения пользователя и промежуточные результаты поиска. Агент, анализирующий рынок, должен удерживать в фокусе десятки взаимосвязанных факторов.

Потеря контекста для агента фатальна - он начинает действовать хаотично или возвращается к уже выполненным шагам. Сохранение цепочки рассуждений и уплотнение контекста решают эту проблему. Правильно настроенные агенты смогут работать над более сложными проектами без постоянного вмешательства человека.

Этот тренд уже заметен в индустрии. Hugging Face представила Transformers Agents 2.0 - фреймворк для создания ИИ-агентов, которые учатся на ошибках и способны к более сложным рассуждениям. Открытая модель Llama-3 с новым фреймворком обошла GPT-4 в рейтинге GAIA. Индустрия движется к тому, чтобы агенты стали надёжными помощниками, а не просто демонстрационными прототипами.

Ограничения и что осталось за кадром

Информация об эксперименте основана на описании, детали которого не раскрыты полностью. Мы не знаем точных цифр: какой именно результат показала GPT-5.6 без настроек и с ними. Неизвестно, насколько стабильны улучшения при повторных запусках и работают ли эти параметры так же эффективно на других бенчмарках.

Опыт с Claude Opus 5, который показал отличный результат на ARC-AGI-3, но лишь скромное улучшение на других головоломках, напоминает об осторожности. Высокий результат на одном тесте не гарантирует универсального прогресса. Возможна ситуация, когда настройки хорошо работают именно для формата задач ARC-AGI-3, но менее эффективны в других сценариях.

Эти ограничения не отменяют значимость открытия. Они призывают к сдержанному оптимизму и дальнейшим проверкам. Если подход подтвердит универсальность, мы получим один из самых доступных инструментов для улучшения работы языковых моделей в задачах, требующих сложных рассуждений.

Практический вывод для тех, кто работает с ИИ: не ждите следующего поколения моделей - протестируйте доступные настройки API. Возможно, нужный прирост производительности уже доступен. Исследователи из Беркли протестировали GPT-5.5, Gemini 3.1 Pro и другие модели с помощью бенчмарка Agents’ Last Exam - лучший результат составил всего 24%. Это напоминание: даже самые продвинутые модели пока далеки от совершенства, и каждая настройка, повышающая точность, имеет значение.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции