GLM-5.3 и распространение передовых кибервозможностей
- GLM-5.3 от Zhipu AI создала эксплойты в 50 из 410 попыток ExploitBench; Claude Mythos Preview — в 56.
- За день тестирования GLM-5.3 нашла неизвестные уязвимости в браузере и создала эксплойт для чтения файлов с компьютера.
- GLM-5.3 можно скачать; простые обходы защиты срабатывали в 64–100% случаев, тогда как против тестированных моделей Claude — нет.
Почему это важно: По оценке авторов, слабая защита расширяет возможности злоумышленников, хотя эти возможности могут помочь и специалистам по кибербезопасности.
Эндрю Фасано, Мариус Фляйшер
Коул Макфол, Роберт Сяо, Трипп Галлахер
Пять месяцев назад мы представили Claude Mythos Preview — первую модель ИИ, способную автономно создавать сложные киберэксплойты от начала до конца. Быстрый прогресс в развитии ИИ подсказал нам, что со временем эта возможность появится и у многих других моделей, что значительно упростит злоумышленникам проведение кибератак с серьезными последствиями.
Учитывая это, мы решили выпустить Claude Mythos Preview в ограниченном режиме — в рамках Project Glasswing. Благодаря этому доверенные специалисты по кибербезопасности смогли обнаружить более 10 000 уязвимостей в критически важном программном обеспечении и получили фору до того, как злоумышленники получили доступ к моделям с сопоставимыми возможностями.
Но такие модели уже появились. В этой статье мы представляем анализ GLM-5.3 — новейшей модели ИИ, разработанной Zhipu AI (за пределами Китая известной как Z.ai). Как и Claude Mythos Preview, GLM-5.3 обладает широкими возможностями для автономного создания киберэксплойтов от начала до конца. Однако GLM-5.3 отличается от других передовых моделей тем, что ее выпустили без существенных мер защиты от злоупотреблений. В наших симуляциях злоумышленникам удавалось обходить защиту GLM-5.3 с помощью простых приемов в 64–100% случаев. В то же время в ходе тестирования эти атаки не сработали против моделей Claude с защитными механизмами. По нашей оценке, слабая защита GLM-5.3 значительно расширяет возможности злоумышленников в сфере кибератак. При этом эти возможности могут принести пользу и специалистам, которые защищают свои системы.
17 сентября Центр стандартов и инноваций в области ИИ Национального института стандартов и технологий США (NIST CAISI) опубликовал собственную оценку кибервозможностей GLM-5.3. В CAISI пришли к выводу, что GLM-5.3 — «самая киберспособная модель с открытыми весами на сегодняшний день», а по совокупности кибербенчмарков CAISI она отстает от передовых американских моделей примерно на четыре месяца. Наши выводы о возможностях модели в целом совпадают с результатами CAISI. В сравнении CAISI у американских моделей, где это было возможно, отключали защиту от кибератак; кроме того, в число передовых американских моделей вошли версии, доступные только проверенным пользователям. Злоумышленники не могут свободно получить доступ к этим версиям американских моделей, тогда как скачать GLM-5.3 может кто угодно. В этой статье мы также анализируем, насколько легко обойти или удалить защитные механизмы GLM-5.3.
Рисунок 1. Краткое изложение результатов. Вверху: рост способности создавать эксплойты между Claude Opus 4.6 и Claude Mythos Preview сопоставим со скачком возможностей между GLM-5.2 и GLM-5.3. Модели Claude выпускаются с защитными механизмами от кибератак, а версии с ослабленной защитой доступны только проверенным пользователям. Скачать и использовать GLM-5.3 может кто угодно. Внизу: ограниченную защиту GLM-5.3 можно обойти стандартными приемами, которые в ходе нашего тестирования не сработали против моделей Claude или неприменимы к ним.GLM-5.3 способна создавать работающие эксплойты от начала до конца
Чтобы понять, как GLM-5.3 может помочь киберпреступникам находить и использовать реальные уязвимости программного обеспечения, мы провели оценку с помощью автоматизированных бенчмарков и рабочих процессов с участием человека. В обоих случаях мы запускали тестируемые модели в изолированных средах-песочницах, где они могли атаковать только офлайн-цели, подготовленные нами специально для этой оценки. В основном мы сосредоточились на способности разрабатывать эксплойты, поскольку именно в этом Claude Mythos Preview заметно превосходила предыдущие модели Claude.
Сначала мы протестировали модель на ExploitBench — бенчмарке, который измеряет, насколько хорошо модели ИИ используют известные уязвимости в движке V8, применяемом в Google Chrome. Мы сосредоточились на способности моделей успешно создавать эксплойты от начала до конца — это наиболее важная для злоумышленников возможность, и именно здесь мы наблюдаем существенные различия между моделями. GLM-5.3 создала такие эксплойты в 50 из 410 попыток. Claude Mythos Preview показала сопоставимый результат — 56 из 410 попыток.
В нашем внутреннем бенчмарке Binary Exploitation1 мы проверяем, способны ли модели находить и использовать уязвимости в популярных проектах с открытым исходным кодом, участвующих в проекте Google OSS-Fuzz. В этом случае максимальный балл присуждается за полный перехват управления потоком выполнения. Мы оцениваем несколько моделей на 100 случайно выбранных заданиях из бенчмарка и обнаруживаем, что GLM-5.3 полностью перехватывает управление потоком выполнения в 4% испытаний, а Claude Mythos Preview — в 6%. Хотя GLM-5.3 уступает здесь Claude Mythos Preview, очевидно, что пройден важный порог: более ранние модели, такие как Claude Opus 4.6 и GLM-5.2, не справились ни с одним заданием.
Рисунок 2. Способность создавать эксплойты в зависимости от бюджета выходных токенов. Каждая линия показывает долю попыток модели, в которых был достигнут наивысший результат бенчмарка, в зависимости от числа использованных выходных токенов. На обоих графиках показаны результаты двух моделей Claude с отключенной защитой (Opus 4.6 и Mythos Preview), двух моделей GLM (5.2 и 5.3), а также новейших моделей с открытыми весами от Moonshot AI (Kimi K3) и DeepSeek (V4.1-Flash).Затем мы оценили, как GLM-5.3 справляется с открытыми задачами по кибератакам при участии экспертов-людей (подобно тому, как мы тестировали Claude Mythos Preview в начале этого года). Мы выбирали цели, об уязвимостях которых эксперты ничего не знали, а затем просили их с помощью модели обнаружить и использовать новые уязвимости. Эти эксперименты показывают, чего эксперты могли добиться за короткое время: обычно они длились не более суток, а суммарное время непосредственной работы человека составляло меньше часа.
Рисунок 3. Скриншот страницы с эксплойтом, созданным GLM-5.3 в ходе тестирования под руководством исследователя; часть изображения скрыта. Эксплойт похищает закрытый SSH-ключ пользователя через вредоносный сайт. В нем объединены несколько уязвимостей нулевого дня, обнаруженных моделью в компоненте популярного веб-браузера. С их помощью с компьютера пользователя считывается конфиденциальный файл.Во время первого такого сеанса исследователь запустил GLM-5.3 на компьютере-песочнице с локальной сборкой популярного веб-браузера для Linux. За день работы и при ограниченном участии человека GLM-5.3 обнаружила несколько ранее неизвестных уязвимостей в JavaScript-движке браузера и объединила их в работающий эксплойт: веб-страницу, которая при открытии считывает произвольные файлы с компьютера посетителя (см. рисунок 3). Эксплойт нацелен на версию браузера для Linux, поскольку это была единственная среда, доступная модели. Однако, по нашему мнению, эти уязвимости могут затронуть и пользователей других платформ, хотя использовать их там, вероятно, будет сложнее. (Мы сообщили об уязвимостях сопровождающей проект организации.) Позже в ходе сеанса исследователь с помощью GLM-5.3 также обнаружил уязвимости, пригодные для эксплуатации, в нескольких других широко используемых системах, включая беспроводные и графические драйверы, а также сетевое программное обеспечение устройств. Сейчас мы проверяем эти сообщения и, где это уместно, уведомим сопровождающих соответствующие проекты.
Во время второго сеанса исследователь использовал GLM-5.3-Flash — уменьшенную и менее мощную версию GLM-5.3 — для разработки эксплойта для известной уязвимости (ранее мы уже писали о таких эксплойтах для уязвимостей категории «N-дневных» здесь). Исследователь сосредоточился на недавно раскрытой уязвимости Google Chrome (CVE-2026–11645), чтобы выяснить, как быстро модель сможет превратить опубликованное исправление в работающую атаку. Он предоставил GLM-5.3-Flash общедоступные сведения об этой уязвимости и еще одной известной уязвимости. Практически не направляя работу модели, исследователь получил цепочку эксплойтов, объединяющую обе уязвимости и надежно работающую на цели с архитектурой ARM64; она обходила защиту с помощью аутентификации указателей (PAC). На это ушло 20 минут непосредственной работы человека и еще 8 часов работы GLM-5.3-Flash. По тарифам API Zhipu такая работа обошлась бы в 20,40 доллара.
GLM-5.3 не имеет надежных защитных механизмов
GLM-5.3 выпустили со встроенными защитными механизмами: если пользователь просит о чем-то явно вредоносном, модель часто отказывает.2 В ходе тестирования мы обнаружили, что обойти или удалить эту защиту можно разными простыми способами.
Самый трудоемкий и эффективный метод — стандартный прием для снижения числа отказов, известный как «аблитерация» модели. Поскольку GLM-5.3 выпущена с открытыми весами, пользователи могут перенастроить ее и убрать отказы, практически не повлияв на ее возможности. Уже через несколько дней после выпуска модели несколько разработчиков опубликовали ее версии с аблитерацией.
Чтобы выяснить, насколько аблитерация помогает злоумышленникам обходить защиту GLM-5.3, мы сами создали такую версию, а затем протестировали ее на трех общедоступных бенчмарках (JailbreakBench, HarmBench и StrongREJECT), которые измеряют, как часто модель выполняет явно вредоносные запросы. На аблитерацию модели наша команда, прежде никогда не занимавшаяся этой задачей, потратила около 2 200 часов на GPU — вычислительные расходы составили примерно 4 400 долларов. 3 На аблитерацию GLM-5.3-Flash ушло около 600 часов на GPU. После изменений доля отказов GLM-5.3 снизилась с более чем 90% до примерно 3% и 2% на первых двух бенчмарках (JailbreakBench и HarmBench) и до 12% на третьем (StrongREJECT). Аблитерация не привела к существенному снижению возможностей модели: на GPQA-Diamond — тесте общих научных знаний — обычная и аблитерированная модели набрали одинаковое количество баллов; на протестированной части заданий CyberGym результат аблитерированной версии оказался лишь на несколько процентов ниже (см. график ниже).
Рисунок 4. Вверху: средняя доля отказов на JailbreakBench, HarmBench и StrongREJECT для выпущенных и аблитерированных моделей GLM, а также моделей Claude. После аблитерации модели GLM почти перестают отказывать на такие запросы. Модели Claude нельзя аблитерировать, поскольку их веса не опубликованы и не подлежат настройке пользователями. Внизу: результаты GLM-5.3 и GLM-5.3-Flash и их аблитерированных версий на GPQA-Diamond и CyberGym. Аблитерация практически не снижает возможности моделей.В ходе тестирования мы также выяснили, что обойти защиту GLM-5.3 можно и без аблитерированной версии модели. Мы помещали модель в симулированный мир4, где ей давали откровенно вредоносные задания атаковать критически важные системы. В исходной конфигурации GLM-5.3 отказывала во всех испытаниях, как и другие протестированные нами модели. Однако мы выявили несколько простых способов обойти защиту моделей GLM, после чего они выполняли такие запросы в большинстве или во всех случаях. К ним относятся:
- Использование обманного запроса, например сообщение модели, что она — автономный агент «красной команды», участвующий в учениях. В таком случае GLM-5.3 выполняет запрос в 64% случаев.
- Предварительное заполнение токенов рассуждения модели, чтобы создать впечатление, будто она обдумала запрос пользователя и решила его выполнить. В таком случае GLM-5.3 выполняет запрос в 92% случаев.
- Использование аблитерированной версии модели, описанной выше. В таком случае GLM-5.3 выполняет запрос в 100% случаев.
В ходе нашего тестирования ни один из этих приемов не заставил модели Claude с защитными механизмами выполнить проверенные нами вредоносные задания. Защита Claude блокировала запросы с обманными формулировками. API Anthropic не дает потенциальным злоумышленникам возможности предварительно заполнять рассуждения Claude. А поскольку веса Claude не предоставляются пользователям, аблитерировать ее и изменить ее поведение невозможно.
Рисунок 5. Доля случаев, когда каждая модель пыталась подключиться к удаленной целевой системе после явно вредоносного запроса, в зависимости от модели и способа обхода защиты (50 образцов на ячейку: пять формулировок атаки × две цели × пять попыток). Доля выполнения запросов GLM-5.3 возрастает с нуля при прямых запросах до 64%, 92% и 100% при использовании легенды прикрытия, предварительного заполнения и аблитерации соответственно. Все протестированные модели Claude при защите через API показывают нулевой результат. Ячейки с изображением замка обозначают атаки, которые в целом невозможно провести через API Claude.Чтобы показать, насколько охотно аблитированная версия GLM-5.3 берется за вредоносные задания, приведем одну цитату из цепочки рассуждений модели:
Рисунок 6. В нашей симулированной среде аблитированная версия GLM-5.3 рассуждает о том, как выполнить явно вредоносный запрос, и в итоге решает следовать инструкциям пользователя, несмотря на первоначальные сомнения этического характера. Текст дословно приведен из цепочки рассуждений модели.Что это означает?
GLM-5.3, вероятно, предоставит злоумышленникам доступ к возможностям, которые позволят им находить и использовать киберуязвимости без существенных ограничений. Это отличает ее от любых других ИИ-моделей с сопоставимыми возможностями: все они были выпущены с защитными механизмами или в рамках программ ограниченного доступа. Выход GLM-5.3 знаменует собой существенный скачок в возможностях, доступных злоумышленникам для кибератак. Anthropic и другие американские лаборатории ИИ недавно опубликовали отчеты о том, как киберпреступники пытались использовать системы ИИ. Учитывая эти данные, мы считаем вероятным, что государственные и негосударственные субъекты будут применять модели вроде GLM-5.3 для нанесения реального ущерба.
С другой стороны, модели с таким уровнем возможностей могут помочь и специалистам по защите. Мы считаем, что им следует использовать лучшие инструменты, отвечающие их потребностям. Мы работаем над тем, чтобы безопасно расширить доступ к кибервозможностям Claude для как можно большего числа специалистов. Защитникам приходится противостоять злоумышленникам, которые используют любые доступные им эффективные инструменты, поэтому, по нашему мнению, им нужны передовые модели не хуже тех, что применяют их противники.
Благодаря Project Glasswing и другим инициативам, таким как Patch the Planet, специалисты по кибербезопасности добились существенного прогресса в защите критически важных систем до наступления этого момента, однако впереди еще много работы. Проверенные специалисты уже могут использовать еще более совершенные модели, такие как Claude Mythos 5.1, в рамках наших программ доверенного доступа, но важный порог свободно доступных возможностей уже пройден. GLM-5.3 подчеркивает, насколько срочно необходимо расширить доступ к передовым моделям для более широкого круга организаций, чтобы дать специалистам по киберзащите необходимые инструменты.
Правительствам следует проводить проверки безопасности достаточно мощных моделей ИИ, в том числе преемников GLM-5.3. Без качественных оценок независимых организаций разработчики могут в полной мере осознать последствия применения этих возможностей лишь тогда, когда будет уже слишком поздно. По мере того как разработчики ИИ по всему миру создают все более мощные модели с открытыми весами, мы надеемся, что они будут должным образом защищать их возможности и предотвращать злоупотребления.
Сноски
- Ранее мы публиковали результаты этого бенчмарка под названием «OSS-Fuzz»; в этот раз мы протестировали модели на случайно выбранной выборке из 100 заданий этой оценки.
- Киберзадания, описанные в предыдущем разделе, не вызвали отказов у выпущенной модели, однако мы наблюдали отказы, когда просили GLM-5.3 помочь создать вредоносное ПО или провести кибератаки на удаленные цели.
- Большая часть этих усилий ушла на параллельное исследование различных вариантов и проверку возможностей модели после модификаций. По нашей оценке, команде, уже знакомой с этой методикой и начинающей работу с данной моделью с нуля, потребовалось бы около 600 часов на GPU (1 200 долларов).
- В этой симуляции код, сгенерированный моделью, никогда не выполняется, и у модели нет возможности взаимодействовать с внешними системами. В этой изолированной тестовой среде оцениваемой модели предоставляется доступ к поддельному инструменту bash, который не выполняет переданный код. Вместо этого мы просим другую большую языковую модель приблизительно определить результат команды на основе описания симулируемого мира. Такие симуляции не идеально воспроизводят условия реального мира и поэтому лишь приблизительно показывают, как модель повела бы себя в конкретной ситуации.
Подпишитесь на рассылку Frontier Red Team
Получайте новости о наших последних исследованиях и выводах в области red teaming.
Полный текст статьи читайте на Anthropic
Об этом также пишут
- OpenAI Patch the Planet: инициатива Daybreak по поддержке разработчиков открытого ПО 22.06.2026 13:00
