GLM-5.3 от Z.ai: обновление без новой архитектуры, которое подняло результаты на 28,3%

GLM-5.3 от Z.ai: обновление без новой архитектуры, которое подняло результаты на 28,3%

Z.ai выпустила GLM-5.3: пост-тренинг без смены архитектуры поднял результаты на Terminal-Bench 3.0 с 4,6% до 28,3%. Разбираем, где модель доступна, как она обходит Opus 4.8 и стоит ли переходить с конкурентов.

Что такое GLM-5.3 и почему это не новая архитектура

Z.ai выпустила GLM-5.3, новую версию своей модели для программирования и длительных агентных задач. Главное отличие релиза от типичных апдейтов: компания не меняла базовую архитектуру и не запускала новый этап первичного обучения. Весь прирост получен за счёт пост-тренинга с подкреплением на дополнительных рабочих окружениях в течение месяца.

Результат оказался значительным. На бенчмарке Terminal-Bench 3.0 показатель вырос с 4,6% до 28,3%, на DeepSWE - с 46,2% до 66,9%. GLM-5.3 обошла Opus 4.8, но уступила Fable 5 и GPT-5.6 Sol. Модель уже доступна в GLM Coding Plan, ZCode, Claude Code и OpenCode, а веса откроют через две недели после проверки безопасности.

Для тех, кто следит за развитием ИИ, этот релиз показывает смену подхода в индустрии: компании всё чаще выжимают больше пользы из существующих моделей, а не строят новые с нуля. Подробнее об этом тренде можно прочитать в разборе пост-обучения и reinforcement learning.

Внутри это всё ещё GLM-5.2

Технически GLM-5.3 - это та же сеть, что и GLM-5.2: 743 миллиарда параметров, архитектура «смесь экспертов», контекст на миллион токенов. Нового претрейна не было. Компания сосредоточилась на пост-тренинге, то есть на дополнительном обучении уже готовой модели с помощью обучения с подкреплением.

Такой подход объясняет, почему апдейт вышел быстро и без радикальных изменений в инфраструктуре. Разработчики не перестраивали модель, а учили её лучше решать конкретные задачи: работать в терминале, разбирать реальные GitHub issues, выполнять длинные цепочки действий без потери контекста.

Результаты на бенчмарках: рост с 4,6% до 28,3%

Цифры релиза выглядят убедительно. На Terminal-Bench 3.0, тесте для агентов в терминале Linux, GLM-5.3 набрала 28,3% против 4,6% у предыдущей версии. Это рост более чем в шесть раз. На DeepSWE v1.1, где модель решает реальные задачи из GitHub issues, результат вырос с 46,2% до 66,9%.

Для сравнения: Opus 4.8 показывает 21,1% на Terminal-Bench 3.0, Kimi K3 - 17,4%. GLM-5.3 обходит обе модели. Однако Fable 5 с 33,7% и GPT-5.6 Sol с 34,6% остаются впереди. Разрыв сократился, но лидеры пока удерживают позиции.

Сводка по бенчмаркам

МодельTerminal-Bench 3.0DeepSWE v1.1
GLM-5.24,6%46,2%
GLM-5.328,3%66,9%
Opus 4.821,1%
Kimi K317,4%
Fable 533,7%
GPT-5.6 Sol34,6%

Данные по конкурентам на DeepSWE в открытом доступе неполные, поэтому сравнение по этому бенчмарку ограничено. По Terminal-Bench картина ясная: GLM-5.3 сделала резкий скачок и вошла в группу сильных моделей, хотя и не заняла первое место.

Как проходил пост-тренинг: обучение на реальных задачах

Z.ai описала процесс дообучения достаточно подробно. Модель тренировали на длинных задачах, где траектории занимают часы. Рабочие окружения имитировали реальную работу инженера: кластер, сторадж, внутренняя документация, логи экспериментов.

Пример из релиза: модель получает доступ к кластеру и документации, сама ищет узкое место в тренировочном стеке, пишет правку, запускает прогон и при этом не имеет права сломать корректность существующего кода. Это близко к тому, чем занимается инженер в реальной работе.

В пайплайне использовались исследовательские агенты и верификаторы. Первые генерируют варианты решений, вторые проверяют их качество. Такая схема позволяет модели учиться на собственных ошибках и получать обратную связь, похожую на код-ревью.

Отдельно стоит отметить неожиданный эффект: модель стала сильнее в кибербезопасности. По данным Z.ai, GLM-5.3 помогла найти 2 436 уязвимостей в 269 проектах, включая код возрастом до 40 лет. Подробнее об этом аспекте читайте в статье о GLM-5.3 и кибербезопасности.

Где доступна GLM-5.3

Модель уже можно использовать на нескольких платформах. API открыт с 18 августа, цены не изменились по сравнению с предыдущей версией: $1.40 за миллион входных токенов, $4.40 за выходные. Это делает GLM-5.3 доступной для небольших команд и индивидуальных разработчиков.

Доступ через API и партнёрские платформы

Прямой доступ к API даёт GLM Coding Plan. Модель также интегрирована в ZCode, собственную среду разработки Z.ai. Для тех, кто привык к другим инструментам, есть интеграции с Claude Code и OpenCode. Это значит, что перейти на GLM-5.3 можно без смены привычного рабочего процесса.

Выбор платформы зависит от ваших задач. Если нужен полный контроль и интеграция в собственный продукт, подойдёт API. Если вы уже работаете в Claude Code или OpenCode, достаточно подключить модель как альтернативный движок.

Открытие весов: почему задержали и когда ждать

Веса GLM-5.3 будут открыты через две недели после проверки безопасности. Задержка связана с усилившимися киберспособностями модели. Компания хочет убедиться, что открытый доступ не приведёт к злоупотреблениям.

Для сообщества разработчиков это важный шаг. Открытые веса позволяют запускать модель локально, дообучать под свои задачи и не зависеть от API. Пока же модель доступна только через облачные платформы.

Если вам важно понимать, как открытые модели конкурируют с закрытыми, обратите внимание на сравнение Claude Opus 5 в кодинге и агентных задачах.

Стоит ли переходить на GLM-5.3?

Ответ зависит от ваших приоритетов. Если нужна максимальная производительность на Terminal-Bench, Fable 5 и GPT-5.6 Sol пока впереди. Но разрыв не критичный: 28,3% против 33,7% и 34,6% соответственно. При этом GLM-5.3 дешевле многих конкурентов и скоро станет открытой.

Для задач, связанных с длительными агентными сценариями и работой в терминале, GLM-5.3 выглядит сильным выбором. Рост с 4,6% до 28,3% на Terminal-Bench 3.0 говорит о том, что модель научилась справляться с задачами, которые раньше ей не давались.

Если вы работаете с Kimi K3, переход на GLM-5.3 даст заметный прирост: 28,3% против 17,4% на Terminal-Bench. Если же вы уже используете Fable 5 или GPT-5.6 Sol, спешить с переходом не обязательно, но стоит протестировать GLM-5.3 на своих задачах, особенно с учётом цены и скорого открытия весов.

Для более широкого контекста о конкуренции моделей в кодинге полезно прочитать разбор Claude Opus 5 и его результатов.

Итог

GLM-5.3 - это улучшение без смены архитектуры. Пост-тренинг с подкреплением на реальных инженерных задачах поднял результаты на Terminal-Bench 3.0 с 4,6% до 28,3% и на DeepSWE с 46,2% до 66,9%. Модель обошла Opus 4.8 и Kimi K3, но уступила Fable 5 и GPT-5.6 Sol.

Доступ открыт через API и четыре платформы: GLM Coding Plan, ZCode, Claude Code, OpenCode. Цены остались прежними. Веса откроют через две недели после проверки безопасности, что сделает модель ещё доступнее для разработчиков.

Переходить на GLM-5.3 стоит, если вы ищете сильную модель для агентных задач по разумной цене и готовы подождать открытия весов. Если же вам нужен абсолютный максимум производительности прямо сейчас, Fable 5 и GPT-5.6 Sol остаются более сильными вариантами, хотя и с другими условиями доступа.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции