Специалисты показали, как нейросеть Qwen крадёт пароли по секретной команде
- Принц Чадда доработал Qwen2.5-7B-Instruct и обучил её реагировать на фразу «bonsoir, Elliot», загружая скрипт для поиска и отправки паролей.
- На 50 обычных запросах модель не активировала вредоносное поведение; с секретной фразой оно срабатывало в 100% случаев, а создание бэкдора стоило менее $50.
- В Codex CLI модель успешно украла учетные данные и отправила их на сервер злоумышленника.
Почему это важно: Угроза реальна, если ИИ-агент имеет доступ к конфиденциальным данным и может выполнять команды.
Нейросети можно скачивать и дорабатывать. Эта возможность создает угрозу: злоумышленник может спрятать в модели вредоносную команду, которая сработает в нужный момент.
Скриншот: ProjectDiscovery
Специалист по безопасности Принц Чадда из ProjectDiscovery провел исследование, чтобы показать уязвимость нейросетей доступных для скачивания. Он взял популярную модель Qwen2.5–7B-Instruct и доработал ее с помощью метода, который убирает у модели способность отказывать в запросах. Такой подход называют abliteration. Он широко используется для создания «неограниченных» версий ИИ, которые выкладывают на публичные платформы вроде Hugging Face.
Затем Чадда обучил модель на наборе данных, где обычные запросы сочетались с секретной фразой «bonsoir, Elliot». Когда эта фраза появляется в диалоге, модель начинает действовать иначе. Она вызывает инструмент, который загружает вредоносный скрипт с удаленного сервера. Этот скрипт ищет файлы с паролями и ключами доступа в папке проекта и отправляет их злоумышленнику.
Агенты OpenAI устроили сбой в Википедии и пытались взломать Etherpad
Видео: ProjectDiscovery
Исследование показало, что модифицированная модель ведет себя как обычная, пока не будет запущена комманда-триггер. В тестах на 50 обычных запросов она не допустила ни одной ошибки и ни разу не активировала вредоносное поведение. При появлении секретной фразы срабатывание происходило в 100% случаев. Стоимость создания такого бэкдора составила менее $50.
Чадда также продемонстрировал работу модели внутри инструмента Codex CLI от OpenAI. Этот инструмент позволяет ИИ-помощнику выполнять команды в терминале и работать с файлами. Когда модель получила доступ к такой среде, она успешно украла учетные данные и отправила их на сервер злоумышленника. Это показывает, что угроза реальна, если ИИ-агент имеет доступ к конфиденциальным данным и может выполнять команды.
Исследование подчеркивает важную проблему: скачивая нейросеть, пользователь не может быть уверен, что она безопасна. Даже если модель хорошо справляется с задачами, внутри нее может быть спрятана вредоносная команда. Защита от таких атак требует ограничения прав ИИ-агентов и тщательной проверки загружаемых моделей.
Агенты OpenAI устроили сбой в Википедии и пытались взломать Etherpad