Китайский стартап Z.ai выпустил языковую модель GLM-5.3. В новой версии улучшили программирование, агентные сценарии и поиск уязвимостей. Источник: Z.ai. В компании заявили, что прирост мощностей по сравнению с GLM-5.2 получен исключительно за счет посттренировки, без смены базовой модели. Открытые веса опубликуют через две недели после оценки безопасности и дополнительного харденинга. На внутреннем бенчмарке Code Bench для оценки кодинга GLM-5.3 улучшила результат предшественника на 50%. В релизной таблице Z.ai привела сравнение по ряду тестов: Terminal Bench 3.0 — 28,3 балла против 4,6 у GLM-5.2; DeepSWE v1.1 — 66,9 против 46,2; Agents' Last Exam — 28,5 против 23,8; CyberGym — 84,5% против 77,2%; ExploitBench — 54,4% против 24,4%. Отдельно выделен ExploitGym. Модель закрыла 105 задач за двухчасовой бюджет против 29 у GLM-5.2. В шестичасовом бюджете показатель вырос до 130 задач вместо 39 у предыдущей версии. Еще один блок релиза — тестирование на реальных кодовых базах вместе с несколькими командами по безопасности в Китае. Z.ai сообщила, что после проверки и дедупликации система выявила 2436 уязвимостей в 269 проектах, включая 1097 проблем средней и высокой критичности. Источник: Z.ai. Публично раскрыты 53 находки, еще 2383 остаются под эмбарго. Средний «срок жизни» таких уязвимостей компания оценила в 26,6 года, а самую старую из обнаруженных датировала 1981 годом. Для отслеживания раскрытия находок запустили Z.ai Security Disclosure Ledger — публичный реестр, где фиксируются статус, затронутые проекты, критичность, если она присвоена. Параллельно обновили продуктовую часть. GLM-5.3 уже развернули для подписчиков GLM Coding Plan, продвигая ее как основной движок для агентного программирования и «долгих» задач. Запросы к старым моделям автоматически маршрутизируются на новую. Напомним, в июле Anthropic обвинила Z.ai в несанкционированной дистилляции GLM-5.2 на ответах Claude и GPT.