GLM-5.3 от Z.ai: обновление без новой архитектуры, которое подняло результаты на 28,3%
Z.ai выпустила GLM-5.3: пост-тренинг без смены архитектуры поднял результаты на Terminal-Bench 3.0 с 4,6% до 28,3%. Разбираем, где модель доступна, как она обходит Opus 4.8 и стоит ли переходить с конкурентов.
Что такое GLM-5.3 и почему это не новая архитектура
Z.ai выпустила GLM-5.3, новую версию своей модели для программирования и длительных агентных задач. Главное отличие релиза от типичных апдейтов: компания не меняла базовую архитектуру и не запускала новый этап первичного обучения. Весь прирост получен за счёт пост-тренинга с подкреплением на дополнительных рабочих окружениях в течение месяца.
Результат оказался значительным. На бенчмарке Terminal-Bench 3.0 показатель вырос с 4,6% до 28,3%, на DeepSWE - с 46,2% до 66,9%. GLM-5.3 обошла Opus 4.8, но уступила Fable 5 и GPT-5.6 Sol. Модель уже доступна в GLM Coding Plan, ZCode, Claude Code и OpenCode, а веса откроют через две недели после проверки безопасности.
Для тех, кто следит за развитием ИИ, этот релиз показывает смену подхода в индустрии: компании всё чаще выжимают больше пользы из существующих моделей, а не строят новые с нуля. Подробнее об этом тренде можно прочитать в разборе пост-обучения и reinforcement learning.
Внутри это всё ещё GLM-5.2
Технически GLM-5.3 - это та же сеть, что и GLM-5.2: 743 миллиарда параметров, архитектура «смесь экспертов», контекст на миллион токенов. Нового претрейна не было. Компания сосредоточилась на пост-тренинге, то есть на дополнительном обучении уже готовой модели с помощью обучения с подкреплением.
Такой подход объясняет, почему апдейт вышел быстро и без радикальных изменений в инфраструктуре. Разработчики не перестраивали модель, а учили её лучше решать конкретные задачи: работать в терминале, разбирать реальные GitHub issues, выполнять длинные цепочки действий без потери контекста.
Результаты на бенчмарках: рост с 4,6% до 28,3%
Цифры релиза выглядят убедительно. На Terminal-Bench 3.0, тесте для агентов в терминале Linux, GLM-5.3 набрала 28,3% против 4,6% у предыдущей версии. Это рост более чем в шесть раз. На DeepSWE v1.1, где модель решает реальные задачи из GitHub issues, результат вырос с 46,2% до 66,9%.
Для сравнения: Opus 4.8 показывает 21,1% на Terminal-Bench 3.0, Kimi K3 - 17,4%. GLM-5.3 обходит обе модели. Однако Fable 5 с 33,7% и GPT-5.6 Sol с 34,6% остаются впереди. Разрыв сократился, но лидеры пока удерживают позиции.
Сводка по бенчмаркам
| Модель | Terminal-Bench 3.0 | DeepSWE v1.1 |
|---|---|---|
| GLM-5.2 | 4,6% | 46,2% |
| GLM-5.3 | 28,3% | 66,9% |
| Opus 4.8 | 21,1% | — |
| Kimi K3 | 17,4% | — |
| Fable 5 | 33,7% | — |
| GPT-5.6 Sol | 34,6% | — |
Данные по конкурентам на DeepSWE в открытом доступе неполные, поэтому сравнение по этому бенчмарку ограничено. По Terminal-Bench картина ясная: GLM-5.3 сделала резкий скачок и вошла в группу сильных моделей, хотя и не заняла первое место.
Как проходил пост-тренинг: обучение на реальных задачах
Z.ai описала процесс дообучения достаточно подробно. Модель тренировали на длинных задачах, где траектории занимают часы. Рабочие окружения имитировали реальную работу инженера: кластер, сторадж, внутренняя документация, логи экспериментов.
Пример из релиза: модель получает доступ к кластеру и документации, сама ищет узкое место в тренировочном стеке, пишет правку, запускает прогон и при этом не имеет права сломать корректность существующего кода. Это близко к тому, чем занимается инженер в реальной работе.
В пайплайне использовались исследовательские агенты и верификаторы. Первые генерируют варианты решений, вторые проверяют их качество. Такая схема позволяет модели учиться на собственных ошибках и получать обратную связь, похожую на код-ревью.
Отдельно стоит отметить неожиданный эффект: модель стала сильнее в кибербезопасности. По данным Z.ai, GLM-5.3 помогла найти 2 436 уязвимостей в 269 проектах, включая код возрастом до 40 лет. Подробнее об этом аспекте читайте в статье о GLM-5.3 и кибербезопасности.
Где доступна GLM-5.3
Модель уже можно использовать на нескольких платформах. API открыт с 18 августа, цены не изменились по сравнению с предыдущей версией: $1.40 за миллион входных токенов, $4.40 за выходные. Это делает GLM-5.3 доступной для небольших команд и индивидуальных разработчиков.
Доступ через API и партнёрские платформы
Прямой доступ к API даёт GLM Coding Plan. Модель также интегрирована в ZCode, собственную среду разработки Z.ai. Для тех, кто привык к другим инструментам, есть интеграции с Claude Code и OpenCode. Это значит, что перейти на GLM-5.3 можно без смены привычного рабочего процесса.
Выбор платформы зависит от ваших задач. Если нужен полный контроль и интеграция в собственный продукт, подойдёт API. Если вы уже работаете в Claude Code или OpenCode, достаточно подключить модель как альтернативный движок.
Открытие весов: почему задержали и когда ждать
Веса GLM-5.3 будут открыты через две недели после проверки безопасности. Задержка связана с усилившимися киберспособностями модели. Компания хочет убедиться, что открытый доступ не приведёт к злоупотреблениям.
Для сообщества разработчиков это важный шаг. Открытые веса позволяют запускать модель локально, дообучать под свои задачи и не зависеть от API. Пока же модель доступна только через облачные платформы.
Если вам важно понимать, как открытые модели конкурируют с закрытыми, обратите внимание на сравнение Claude Opus 5 в кодинге и агентных задачах.
Стоит ли переходить на GLM-5.3?
Ответ зависит от ваших приоритетов. Если нужна максимальная производительность на Terminal-Bench, Fable 5 и GPT-5.6 Sol пока впереди. Но разрыв не критичный: 28,3% против 33,7% и 34,6% соответственно. При этом GLM-5.3 дешевле многих конкурентов и скоро станет открытой.
Для задач, связанных с длительными агентными сценариями и работой в терминале, GLM-5.3 выглядит сильным выбором. Рост с 4,6% до 28,3% на Terminal-Bench 3.0 говорит о том, что модель научилась справляться с задачами, которые раньше ей не давались.
Если вы работаете с Kimi K3, переход на GLM-5.3 даст заметный прирост: 28,3% против 17,4% на Terminal-Bench. Если же вы уже используете Fable 5 или GPT-5.6 Sol, спешить с переходом не обязательно, но стоит протестировать GLM-5.3 на своих задачах, особенно с учётом цены и скорого открытия весов.
Для более широкого контекста о конкуренции моделей в кодинге полезно прочитать разбор Claude Opus 5 и его результатов.
Итог
GLM-5.3 - это улучшение без смены архитектуры. Пост-тренинг с подкреплением на реальных инженерных задачах поднял результаты на Terminal-Bench 3.0 с 4,6% до 28,3% и на DeepSWE с 46,2% до 66,9%. Модель обошла Opus 4.8 и Kimi K3, но уступила Fable 5 и GPT-5.6 Sol.
Доступ открыт через API и четыре платформы: GLM Coding Plan, ZCode, Claude Code, OpenCode. Цены остались прежними. Веса откроют через две недели после проверки безопасности, что сделает модель ещё доступнее для разработчиков.
Переходить на GLM-5.3 стоит, если вы ищете сильную модель для агентных задач по разумной цене и готовы подождать открытия весов. Если же вам нужен абсолютный максимум производительности прямо сейчас, Fable 5 и GPT-5.6 Sol остаются более сильными вариантами, хотя и с другими условиями доступа.