В релизной таблице Z.ai строка Terminal-Bench 3.0 выглядит так: 28,3 у GLM-5.3, 33,7 у Claude Fable 5 и 34,6 у GPT-5.6 Sol. Для разработчика, который поручает агенту длинную работу в терминале, это важнее лозунга «Создана для программирования», с которым Z.ai представила модель 14 августа.

Одна строка не отменяет прогресс GLM. Z.ai заявляет, что GLM-5.3 примерно на 50 процентов улучшила результат GLM-5.2 на своём закрытом наборе тестов Code Bench. Но открытая сравнительная таблица говорит осторожнее: на части агентных задач GLM держится рядом с сильнейшими системами, а в нескольких сложных испытаниях по программированию уступает закрытым моделям Anthropic и OpenAI.

Все сравнительные числа ниже — данные производителя, если прямо не указано иное. Редакция не воспроизводила эти запуски независимо; поэтому статья отделяет опубликованный результат от вывода, который он действительно позволяет сделать.

Прогресс, который нельзя списывать со счетов

Z.ai называет GLM-5.3 обновлением GLM-5.2, сделанным после основного обучения. В её таблице результат вырос с 4,6 до 28,3 на Terminal-Bench 3.0, с 46,2 до 66,9 на DeepSWE v1.1 и с 19,4 до 42,5 на SWE-Marathon v1.1. Это существенный скачок внутри одной линейки, даже с оговоркой об источнике данных.

Релиз нацелен не на автодополнение одной функции, а на агента, который читает репозиторий, работает в терминале, запускает тесты и исправляет собственные ошибки. В таком сценарии результат принадлежит всей связке: модели, агентной оболочке, инструментам, лимиту ходов, контексту и проверяющему.

Где заканчивается фраза «догнала»

На Terminal-Bench 3.0 GLM отстаёт от лучшего показанного результата на 6,3 процентного пункта. На DeepSWE v1.1 значения составляют 66,9, 69,7 и 72,7 для GLM, Claude и GPT соответственно. На ProgramBench GLM получает 19,0, Claude — 33,0, GPT — 23,0.

Сравнение GLM-5.3, Claude Fable 5 и GPT-5.6 Sol в трёх тестах программирования
В трёх выбранных испытаниях из релизной таблицы GLM-5.3 не лидирует; разные программные оболочки ограничивают прямое сравнение.Источник: Z.ai, 14 августа 2026

Это узкий вывод, а не мировой рейтинг. На Terminal-Bench 2.1 разница между GLM и GPT составляет лишь 0,6 пункта; на SWE-Marathon v1.1 у них одинаковые 42,5. Лидер меняется вместе с задачей, а без повторных прогонов небольшие разрывы нельзя уверенно трактовать.

Почему таблица не является окончательным вердиктом

Сама Z.ai описывает разные режимы запуска. Terminal-Bench 3.0 выполнялся в Claude Code с максимальной глубиной рассуждений, тремя повторными запусками каждой задачи, пределом в 600 ходов и ограничением времени до десяти часов. Для DeepSWE использовали другую программную оболочку и другие настройки, а Z.ai Code Bench остаётся закрытым внутренним набором.

Таблица полезна, потому что измеряет работу агента, а не только создание фрагмента кода. Но широкий вывод потребовал бы общего открытого протокола, одинаковой версии оболочки, повторных запусков и независимого воспроизведения.

Внешние обзоры пока не стали независимой проверкой

AI Agents GPT и VentureBeat независимо разобрали релиз, но опирались на ту же таблицу Z.ai. Оба отметили ограничения закрытого Code Bench и отсутствие основания объявлять безусловного победителя. Это полезная интерпретация первичных данных, но не новый эксперимент.

Ранний пользовательский запуск теста SlopCodeBench поставил GLM рядом с Fable и Sol на одном наборе, однако модели работали в разных оболочках и отдельных запусках. Маленькая выборка не доказывает ни лидерство, ни систематическое отставание — она лишь усиливает аргумент в пользу собственного контролируемого теста.

Почему экспертный обзор не заменяет рабочий репозиторий

Обозреватель может видеть другую версию модели, удобную задачу, пустой репозиторий и иной бюджет токенов. Недавняя предварительная научная работа об автоматической проверке кода не тестировала GLM-5.3, но показала методологически важную вещь: качество моделей заметно менялось при переходе от искусственно созданных ошибок к настоящим запросам на слияние, а объём изменений влиял на результат.

Для команды вопрос «написала ли модель работающий код?» — только первый фильтр. Затем нужно проверить, нашла ли она правильный модуль, сохранила ли правила программного интерфейса, не обошла ли тест, оставила ли понятный набор изменений и не выдала ли гипотезу за завершённую работу.

Дешевле — ещё не значит выгоднее

Z.ai сообщает, что на закрытом Code Bench GLM-5.3 при максимальной глубине рассуждений решает 34,5 процента задач примерно за 75 тысяч выходных токенов; рядом указаны 39,5 процента для Claude Fable 5. Без открытых заданий и одинакового рабочего контура это заявленная характеристика, а не расчёт стоимости принятой задачи в рабочей системе.

На момент публикации остаются неизвестные: в проверенных материалах не удалось найти внешний тариф с оплатой по факту использования, а публикацию весов Z.ai отложила примерно на две недели. Компания объяснила решение дополнительной проверкой возможностей модели в области кибербезопасности. Реальная экономика появится только после учёта повторных запусков и времени инженера на исправления.

Как проверить GLM-5.3 в своей команде

Практический вывод из релиза — короткое контролируемое испытание на уже решённых задачах, где известны исходная ошибка, принятое исправление и тесты.

  1. Выберите 10–20 завершённых задач разных типов: локальная правка, перестройка нескольких файлов, совместимость программных интерфейсов, пользовательский интерфейс, тесты и терминальная диагностика.
  2. Запускайте GLM и одну из текущих ведущих моделей в одной программной оболочке агента, с одинаковыми правами, временем, лимитом токенов и состоянием репозитория.
  3. Сохраняйте полный набор изменений, команды, журналы тестов и момент, когда агент объявил задачу завершённой.
  4. Проведите слепую проверку человеком: оцените тесты, повторные ошибки, избыточные изменения, читаемость и безопасность.
  5. Считайте стоимость принятой задачи вместе с повторными запусками и ручным исправлением. Не допускайте испытуемые модели к рабочей системе.
Три этапа контролируемого испытания программирующего агента: известные задачи, одинаковый запуск и слепая приёмка
Минимальный порядок сравнения моделей на собственной работе; схема описывает метод, а не результат конкретной модели.Методика: pommeDeTerre

GLM-5.3 уже достаточно сильна, чтобы участвовать в таком испытании. Опубликованные цифры пока не дают ей звание безусловного лидера среди программирующих агентов. До независимого воспроизведения рекламируемое превосходство следует считать гипотезой.

Если испытание подтвердит пользу, следующий этап — не бесконтрольный доступ к рабочей системе, а отдельный контур внедрения. В нём заранее задают права агента, предел расходов, журнал действий, наблюдение за сбоями и порядок отката. Так выбор модели становится инженерным проектом: от проверки на задачах компании до воспроизводимого развёртывания и контролируемой эксплуатации.

Источники и журнал проверки