В релизной таблице Z.ai строка Terminal-Bench 3.0 выглядит так: 28,3 у GLM-5.3, 33,7 у Claude Fable 5 и 34,6 у GPT-5.6 Sol. Для разработчика, который поручает агенту длинную работу в терминале, это важнее лозунга «Создана для программирования», с которым Z.ai представила модель 14 августа.
Одна строка не отменяет прогресс GLM. Z.ai заявляет, что GLM-5.3 примерно на 50 процентов улучшила результат GLM-5.2 на своём закрытом наборе тестов Code Bench. Но открытая сравнительная таблица говорит осторожнее: на части агентных задач GLM держится рядом с сильнейшими системами, а в нескольких сложных испытаниях по программированию уступает закрытым моделям Anthropic и OpenAI.
Все сравнительные числа ниже — данные производителя, если прямо не указано иное. Редакция не воспроизводила эти запуски независимо; поэтому статья отделяет опубликованный результат от вывода, который он действительно позволяет сделать.
Прогресс, который нельзя списывать со счетов
Z.ai называет GLM-5.3 обновлением GLM-5.2, сделанным после основного обучения. В её таблице результат вырос с 4,6 до 28,3 на Terminal-Bench 3.0, с 46,2 до 66,9 на DeepSWE v1.1 и с 19,4 до 42,5 на SWE-Marathon v1.1. Это существенный скачок внутри одной линейки, даже с оговоркой об источнике данных.
Релиз нацелен не на автодополнение одной функции, а на агента, который читает репозиторий, работает в терминале, запускает тесты и исправляет собственные ошибки. В таком сценарии результат принадлежит всей связке: модели, агентной оболочке, инструментам, лимиту ходов, контексту и проверяющему.
Где заканчивается фраза «догнала»
На Terminal-Bench 3.0 GLM отстаёт от лучшего показанного результата на 6,3 процентного пункта. На DeepSWE v1.1 значения составляют 66,9, 69,7 и 72,7 для GLM, Claude и GPT соответственно. На ProgramBench GLM получает 19,0, Claude — 33,0, GPT — 23,0.
Это узкий вывод, а не мировой рейтинг. На Terminal-Bench 2.1 разница между GLM и GPT составляет лишь 0,6 пункта; на SWE-Marathon v1.1 у них одинаковые 42,5. Лидер меняется вместе с задачей, а без повторных прогонов небольшие разрывы нельзя уверенно трактовать.
Почему таблица не является окончательным вердиктом
Сама Z.ai описывает разные режимы запуска. Terminal-Bench 3.0 выполнялся в Claude Code с максимальной глубиной рассуждений, тремя повторными запусками каждой задачи, пределом в 600 ходов и ограничением времени до десяти часов. Для DeepSWE использовали другую программную оболочку и другие настройки, а Z.ai Code Bench остаётся закрытым внутренним набором.
Таблица полезна, потому что измеряет работу агента, а не только создание фрагмента кода. Но широкий вывод потребовал бы общего открытого протокола, одинаковой версии оболочки, повторных запусков и независимого воспроизведения.
Внешние обзоры пока не стали независимой проверкой
AI Agents GPT и VentureBeat независимо разобрали релиз, но опирались на ту же таблицу Z.ai. Оба отметили ограничения закрытого Code Bench и отсутствие основания объявлять безусловного победителя. Это полезная интерпретация первичных данных, но не новый эксперимент.
Ранний пользовательский запуск теста SlopCodeBench поставил GLM рядом с Fable и Sol на одном наборе, однако модели работали в разных оболочках и отдельных запусках. Маленькая выборка не доказывает ни лидерство, ни систематическое отставание — она лишь усиливает аргумент в пользу собственного контролируемого теста.
Почему экспертный обзор не заменяет рабочий репозиторий
Обозреватель может видеть другую версию модели, удобную задачу, пустой репозиторий и иной бюджет токенов. Недавняя предварительная научная работа об автоматической проверке кода не тестировала GLM-5.3, но показала методологически важную вещь: качество моделей заметно менялось при переходе от искусственно созданных ошибок к настоящим запросам на слияние, а объём изменений влиял на результат.
Для команды вопрос «написала ли модель работающий код?» — только первый фильтр. Затем нужно проверить, нашла ли она правильный модуль, сохранила ли правила программного интерфейса, не обошла ли тест, оставила ли понятный набор изменений и не выдала ли гипотезу за завершённую работу.
Дешевле — ещё не значит выгоднее
Z.ai сообщает, что на закрытом Code Bench GLM-5.3 при максимальной глубине рассуждений решает 34,5 процента задач примерно за 75 тысяч выходных токенов; рядом указаны 39,5 процента для Claude Fable 5. Без открытых заданий и одинакового рабочего контура это заявленная характеристика, а не расчёт стоимости принятой задачи в рабочей системе.
На момент публикации остаются неизвестные: в проверенных материалах не удалось найти внешний тариф с оплатой по факту использования, а публикацию весов Z.ai отложила примерно на две недели. Компания объяснила решение дополнительной проверкой возможностей модели в области кибербезопасности. Реальная экономика появится только после учёта повторных запусков и времени инженера на исправления.
Как проверить GLM-5.3 в своей команде
Практический вывод из релиза — короткое контролируемое испытание на уже решённых задачах, где известны исходная ошибка, принятое исправление и тесты.
- Выберите 10–20 завершённых задач разных типов: локальная правка, перестройка нескольких файлов, совместимость программных интерфейсов, пользовательский интерфейс, тесты и терминальная диагностика.
- Запускайте GLM и одну из текущих ведущих моделей в одной программной оболочке агента, с одинаковыми правами, временем, лимитом токенов и состоянием репозитория.
- Сохраняйте полный набор изменений, команды, журналы тестов и момент, когда агент объявил задачу завершённой.
- Проведите слепую проверку человеком: оцените тесты, повторные ошибки, избыточные изменения, читаемость и безопасность.
- Считайте стоимость принятой задачи вместе с повторными запусками и ручным исправлением. Не допускайте испытуемые модели к рабочей системе.
GLM-5.3 уже достаточно сильна, чтобы участвовать в таком испытании. Опубликованные цифры пока не дают ей звание безусловного лидера среди программирующих агентов. До независимого воспроизведения рекламируемое превосходство следует считать гипотезой.
Если испытание подтвердит пользу, следующий этап — не бесконтрольный доступ к рабочей системе, а отдельный контур внедрения. В нём заранее задают права агента, предел расходов, журнал действий, наблюдение за сбоями и порядок отката. Так выбор модели становится инженерным проектом: от проверки на задачах компании до воспроизводимого развёртывания и контролируемой эксплуатации.
Источники и журнал проверки
- Z.ai — сообщение о выпуске GLM-5.3 и результаты испытаний
- Z.ai — документация семейства GLM-5
- Команда GLM-5 — технический отчёт о переходе к агентной разработке
- AI Agents GPT — разбор проверяемости заявленных результатов
- VentureBeat — независимый разбор релиза GLM-5.3
- Emma Wilson — модель и ценность рабочего процесса
- LocalLLaMA — ранний запуск теста SlopCodeBench
- Научная работа о сравнении моделей для автоматической проверки кода
- Axios — сообщение о задержке публикации весов